MiniMax H3 動画生成 —— マルチモーダル参照、4〜15秒を自由に、768P / 2K
MiniMax H3 は画像・動画・音声を同時に参照でき、768P または 2K で出力し、長さは4〜15秒の整数秒から自由に選べます。XinYu AI ではほかのすべてのモデルとポイント残高を共有します。
利用できるバージョン
- MiniMax H3768P / 2K の2段階。4〜15秒の任意の整数秒。テキストから動画、画像から動画、参照から動画、マルチモーダル参照に対応。終了フレームの指定も可能
得意なこと
画像・動画・音声をまとめて参照に
H3 のマルチモーダル参照は画像だけではありません。動画のクリップや音声トラックも同じプロンプトに入れ、トーンやテンポを決められます。
長さは4〜15秒から自由に
5秒と10秒の2択ではなく、その間の整数秒をどれでも選べるので、編集時にコマを足したり強引に切ったりする必要がありません。
終了フレームを指定できる
開始フレームと終了フレームを指定して、狙った画でショットを終えられます。次のショットへのつながりもスムーズです。
XinYu AI で使う理由
ひとつの残高ですべてのモデルを
画像・動画・音声・テキストが同じポイント残高を使います。モデルごとのサブスクリプションやチャージは不要で、ポイントに有効期限はありません。
ひとつのキャンバスでつなげる
生成した画像は次のステップの参照画像に、動画はその場でトリミング・延長・音声付けができます。ツール間の書き出しと読み込みは不要です。
MCP でも CLI でも使える
Claude や Cursor から直接生成したり、CLI を自分のスクリプトや自動化に組み込んだりできます。ブラウザを開く必要はありません。
よくある質問
MiniMax H3 はどのくらいの長さの動画を出力できますか?
4〜15秒の任意の整数秒で、決まったグレードだけではありません。出力解像度は 768P と 2K の2段階で、パネルからそのまま切り替えられます。
「マルチモーダル参照」とは具体的に何ですか?
参照画像1枚だけでなく、同じプロンプトに画像・動画クリップ・音声を同時に参照として入れられることです。動画で動きとテンポを、音声でトーンを決めます。
H3 はテキストだけでの生成に対応していますか?
はい。テキストから動画、画像から動画、参照から動画の3つの入力方式に対応し、終了フレームも指定できます。
参照画像や参照動画を使うときの注意点は?
H3 の提供元は送られた参照メディアを審査し、基準に合わない参照素材は拒否されてポイントは自動で返還されます。参照素材が何度も拒否される場合は、テキストだけの生成に切り替えるか、キャンバス上の別の動画モデルを使ってください。