MiniMax H3 ガイド伝わる動画プロンプトを作る生成画面を開く
MiniMax H3 プロンプトガイドT2VA · I2VA · 開始・終了フレーム · オムニリファレンス

MiniMax H3のプロンプトを、短い撮影指示書のように書く

役に立つMiniMax H3プロンプトは、雰囲気を並べただけのムードボードではありません。ひとつのショットに、明確な被写体、読み取れる舞台、制御された動き、カメラの軌道、必要に応じた音の意図、ラストを与え、中心となる動作と競合する指示を取り除きます。

プロンプトの基本式

被写体 + シーン + 動き + カメラ + 音の意図 + ラスト

再生される順番で決定事項を書きます。中心となる動きがひとつ、明確なカメラの軌道がひとつあるほうが、矛盾する指示を重ねるより意図が伝わります。

被写体
誰を、何を見せるか
シーン
どこで起きるか
動き
時間とともに何が変わるか
カメラ + ラスト
どう見せ、どう締めるか
T2VA
テキストからシーンを考案
I2VA
開始フレームを動かす
FL2V
冒頭 → ラスト
R2VA
オムニリファレンス
プロンプト上限
7,000文字
動画尺
4〜15秒
要点

強いMiniMax H3プロンプトは、タグの羅列ではなく時間の流れ

MiniMax H3は、シーン全体の考案、固定したフレームのアニメーション、開始画像と終了画像の橋渡し、オムニリファレンスの反映に対応します。この組み合わせを安全に導くには、シーン、被写体、動作、カメラ、音の意図、ラストを再生順に並べた短い制作指示が効果的です。

01

キーワードの雲より、再生順

5つの美的方向と3つのカメラワークを同時に選ばせると、ショットはまとまりにくくなります。視聴者が実際に目にする順番で判断事項を並べましょう。

02

形容詞より先に、モードを決める

テキストのみなら世界全体を考案し、開始フレームなら既知の世界を動かし、リファレンスなら信号を引き継ぎます。選んだ仕事に合う書き方をします。

テンプレート

MiniMax H3のモードに合う型から始め、不要なものを削る

見た目が似ていても、モデルに任せる仕事は異なります。文章を磨く前にモードを選びましょう。

テキストから動画 · t2va

シーン構築テンプレート

被写体、環境、冒頭の構図をMiniMax H3に文章から考案させる場合に使います。テキストのみのモードではratioが必須です。

T2VAテンプレート
[動画尺とアスペクト比]。[特徴が分かる被写体]が[具体的な場所と時間帯]にいる。動画を通して[中心となる動作や変化]。カメラは[軌道とフレーミングの変化]。[光、色調、素材感、空気感]。必要なら[台詞や音の意図]。最後は[最終構図や感情の余韻]で終える。
画像から動画 · i2va

動き中心のテンプレート

開始フレームですでに人物・物の特徴、構図、最初の美的方向が決まっている場合に使います。

I2VAテンプレート
画像内の[主な被写体]が[ひとつの明確な動作]をする。[環境や副要素の変化]。被写体の特徴と元のビジュアルスタイルを保ちながら、カメラは[軌道]。必要なら音:[声/環境音の手がかり]。最後は[ポーズやフレーミング]で終える。
開始・終了フレーム

トランジション用テンプレート

2枚のフレームを個別に説明し直すのではなく、最初の画像がどのように最後の画像へ変化するかを書きます。

FL2Vテンプレート
開始フレームから、[被写体の動作と環境の変化]。[カメラの動きとタイミング]。構図が自然に変化して指定した終了フレームへ到達する間も、[人物・物・スタイルの制約]を維持する。
オムニリファレンス · r2va

リファレンス対応表テンプレート

スタイルを形容する前に、各リファレンスの役割を決めます。referenceのroleと開始・終了フレームのroleは併用しません。

R2VAテンプレート
参照画像は[人物/商品/スタイル]に使う。参照動画は[動き/カメラ/リズム]に使う。参照音声がある場合は[声質/話し方]に使う。[シーン]で[動画尺]のショットを作成。被写体の動作:[読み取りやすいひとつの動作]。カメラ:[軌道]。参照した同一性を維持する。最後は[締めの一場面]で終える。
プロンプトの基本式

6つの判断からMiniMax H3の指示書を組み立てる

制御に役立つときだけ詳細を加えます。形容詞を増やすほど、動きと優先度を奪い合います。

01

被写体

中心となる人物、商品、生き物、形を示します。外見の詳細は、見分けるために必要なものだけを加えます。

02

シーンの空間

夜の路地、スタジオ、森の縁、橋の内部、様式化した世界など、被写体を具体的な環境に置きます。

03

動き・変化

動作とシーンの変化を記述します。動画に必要なのは、静的なビジュアルタグの一覧ではなく、時間とともに起きる変化です。

04

カメラの軌道

固定、追従、寄る、引く、上昇、パン、周回などから画角と移動を選び、組み合わせる場合は順番を明確にします。

05

音の意図

台詞、ルームトーン、参照音声が重要なら明記します。r2vaでは、参照音声を映像メディアと組み合わせます。

06

ラストの一場面

表情のクローズアップ、広い風景の提示、振り向きの完了、静止した商品カットなど、ショットが落ち着く場所を示します。

動画尺もプロンプト設計の一部

MiniMax H3では4〜15秒の整数を指定できます。5秒の商品紹介と12秒の人物演技では、必要な動作密度が異なります。短い1本に三幕構成を詰め込まないようにしましょう。

入力モード

最初の一文を書く前にプロンプトのモードを選ぶ

似た文章でも、付与するメディアのroleによってMiniMax H3に任せる仕事が変わります。

T2VA

テキストがフレーム全体を作る

人物・物の外見、環境、冒頭の構図に文章を使います。テキストのみの生成ではratioをadaptiveにできません。

I2VA

開始フレームが同一性を決める

すべての画素を説明し直す必要はありません。動き、カメラ、光の変化、維持すべき特徴を指示します。

FL2V

2つの構図を橋渡しする

何が動き、何が変形し、指定された両端の間でカメラがどう動くかというトランジションの筋道を書きます。

R2VA

各リファレンスが信号を担う

顔、衣装、動き、カメラ表現、声をどのアセットが決めるか対応づけます。同じリクエストで開始・終了フレームのroleは使いません。

リファレンスの確認

ファイルを並べるのではなく、監督のように役割を伝える

メディアをアップロードするだけでは不十分です。プロンプト内で、それぞれに仕事を割り当てます。

同一性

顔、商品、ロゴを決める画像はどれですか?

複数の画像が競合しそうな場合は、文章で明確に指定します。

動き

身体表現やカメラのリズムを決める動画はどれですか?

参照動画は短く、目的を絞ります。公開上限は1本につき2〜15秒です。

声質や話し方を決める音声はどれですか?

音声だけでは送れないため、参照画像または参照動画と組み合わせます。

排他条件

開始・終了フレームとreferenceのroleを混在させていませんか?

混在している場合は2つのタスクに分けます。公開仕様では、両モードは相互排他です。

上限

メディア12ファイル、プロンプト7,000文字以内ですか?

リファレンスの対応関係を削る前に、価値の低い形容詞を減らします。

ラスト

最終フレームを一文で思い描けますか?

思い描けなければ、動きが着地せず漂いやすくなります。

時間レイヤー

動作、カメラ、音を起きる場所に置く

時間を示す言葉は、MiniMax H3が優先度を理解する助けになります。各フレームを細かく管理するのではなく、ショットの段取りに使いましょう。

01
冒頭

空間と被写体を示す

最初の1秒で、誰をどこで見ているかを伝えます。開始フレームですでに状況が読める場合を除き、混乱の真ん中から始めないようにします。

02
展開

中心となる動作をひとつ

中盤には、静止画ではなく動画を生成する理由になる動きを置きます。

03
カメラ

ひとつの軌道、必要なら次の一手

2つのカメラ演出が必要なら、同じ優先度で重ねず、「追従してから寄る」のように順序をつけます。

04
終了

構図を着地させる

最後は、表情が落ち着く、商品が静止する、広い景色が開ける、身振りが完了するなど、明確な一場面で締めます。

プロンプト作例

繰り返し使える4つのMiniMax H3ショット構成

構造を説明するために新しく書いた作例です。情報の優先順位を保ちながら、被写体や舞台を置き換えて使えます。

テキストから動画 · トラッキング

雨に照らされた自転車

被写体の動作をひとつ、カメラの軌道をひとつ、最後に感情が読める一場面を置きます。

5〜8秒のシネマティックショット
8秒、16:9のシネマティックな夜景。反射材のジャケットを着た配達員が、雨に照らされた街の交差点を自転車で横切る。タイヤが水しぶきを上げ、濡れた道路にネオンの反射が長く伸びる。カメラは自転車と並走し、その後、集中した配達員の表情へゆっくり寄る。冷たい青の実景光に、控えめなマゼンタを加え、濡れた路面を写実的に描く。タイヤが水を切る小さな音と、遠くの交通音。最後は表情がはっきり読める斜め前からのクローズアップで終える。
画像から動画 · プロダクト

腕時計を光で見せる

商品デザインは開始フレームに任せ、プロンプトでは光とカメラの動きを演出します。

制御された画像アニメーション
腕時計を中央に保ったまま、細い暖色の光がヘアライン加工のケースを横切る。商品の後ろでは淡い霧がゆっくり動く。時計の形と暗い大理石の台を維持しながら、カメラはわずかに右へ移動する。文字盤を作り変えない。最後は文字盤全体が読み取れる、端正な斜め方向の商品カットで終える。
開始・終了フレーム

スタジオから街へ

制御された2つの構図の間で起きる変化を記述します。

トランジション指示
開始フレームからモデルが前へ歩き、スタジオのソフトボックスが雨の街灯へ溶けるように変化する。布の動きは自然に保ち、人物の同一性を維持する。環境が指定された終了フレームへ移り変わる間、カメラはゆっくり後退する。最後はその構図に正確に重なり、姿勢が落ち着いた状態で終える。
オムニリファレンス

声の手がかりを持つ人物

スタイルを言い換える前に、各リファレンスの役割を決めます。

R2VA指示
参照画像は人物の顔と衣装に使う。参照動画は力の抜けた歩行リズムに使う。参照音声は暖かみのある中音域の声質に使う。ゴールデンアワーの風が吹く海沿いの遊歩道で、10秒のミディアムショットを作成。人物はカメラへ歩き、一度ほほ笑み、自由な気分を表す短い一言を話す。カメラは滑らかに後退して追従する。人物と衣装の同一性を維持する。最後は安定したミディアムクローズアップで終える。
よくある失敗

結果が散らかって見えたら、まず指示を簡潔にする

弱いMiniMax H3プロンプトの多くは、言葉が足りないのではありません。被写体、動作、モード、カメラの優先順位を明確にする必要があります。

キーワードの羅列

時間変化のない静的なスタイルタグ

「シネマティック、美しい、4K、ドラマティック」の代わりに、決めたシーンの中で被写体が行う、目に見えるひとつの動作を書きます。

モードの不一致

i2vaの仕事にt2vaの言葉を使う

開始フレームがある場合、意図的に変えるのでなければ、衣装や背景をゼロから作り直す説明は不要です。

リファレンスの投げ込み

ファイルは多いのに役割がない

顔、動き、声をどのアセットが決めるか対応づけます。役割のないリファレンスはノイズになります。

競合するカメラ

複数の動きを同じ優先度で指定

中心となる軌道をひとつ選びます。2つ目が必要なら、後半に続く動きとして順番を決めます。

物語の詰め込み

1本に場面を入れすぎる

ひとつのショットに、ひとつの役割を与えます。長いシークエンスは、複数の生成動画から組み立てます。

許可されない混在

開始・終了フレームとreferenceのroleを併用

タスクを分けてください。公開されているMiniMax-H3仕様では、この2つのモード群は相互排他です。

生成前の確認

MiniMax H3プロンプトを6つの質問でチェック

一度は監督として、もう一度は時間の流れとしてプロンプトを読み返します。

モード

生成モードは明確ですか?

テキストのみ、開始フレーム、開始 + 終了、オムニリファレンスから、ひとつの仕様を選びます。

被写体

中心となる被写体はひとつですか?

カメラが動き出す前に、視聴者が何を見るべきか分かる状態にします。

シーン

環境は具体的ですか?

結果の見た目が変わる場合は、場所、時間、天候、制作の文脈を示します。

動き

目に見える変化がありますか?

時間を通して起きる動作、変形、表情、環境の出来事を記述します。

カメラ

中心となるカメラの軌道はひとつですか?

補助的な動きには順番をつけ、矛盾する指示を重ねません。

ラスト

最終フレームを思い描けますか?

明確な最後の一場面があると、動きが漂わず自然に着地します。

カメラ用語集

明確な制御が必要なときに使えるカメラ表現

多くのMiniMax H3ショットは自然な文章でカメラを指示できます。精密さが必要な場合も、コマンドは少なくし、順番を明確にしましょう。

横方向の移動

Truck(トラック)

truck lefttruck right

視線の向きを保ちながら、カメラ自体を横へ移動します。

水平方向の回転

Pan(パン)

pan leftpan right

カメラ位置をほぼ固定し、左右へ向きを変えます。

前進・後退

Push / Pull(寄る・引く)

push inpull out

被写体へ物理的に近づく、または遠ざかります。

上下方向の移動

Pedestal / Rise(昇降)

riselower

チルトさせずに、カメラ位置を上げ下げします。

垂直方向の回転

Tilt(チルト)

tilt uptilt down

視線を上または下へ回転させます。

被写体に沿う軌道

Track / Follow(追従)

tracking shotfollow

被写体とともに移動し、読みやすいフレーミングを保ちながら背景を変化させます。

レンズによる画角変化

Zoom(ズーム)

zoom inzoom out

空間内を移動せず、見かけの焦点距離を変えます。

移動なし

Static(固定)

static shotlocked off

カメラを固定し、人物の演技や被写体の動きで映像を見せます。

エネルギー

手持ちカメラの質感

subtle handheldrestrained shake

被写体の動きが読めなくならないよう、控えめに使います。

プロンプトについて

重要なことから先に演出する

MiniMax H3のプロンプトは長く書くべきですか?

長さそのものが目的ではありません。被写体、舞台、動き、カメラの軌道、必要に応じた音の意図、ラストが分かるだけの情報を書き、中心となる動作と競合する指示を削ります。公開上限は7,000文字です。

画像から動画とテキストから動画では、書き方がどう違いますか?

開始フレームがすでに被写体、構図、スタイルを決めています。プロンプトでは、動き、カメラの振る舞い、環境の変化、維持すべき特徴に集中します。

オムニリファレンスのプロンプトはどう書けばよいですか?

スタイルの形容詞を加える前に、各リファレンスへ顔、衣装、動き、カメラのリズム、声といった役割を割り当てます。メディアは公開上限内に収め、referenceのroleと開始・終了フレームのroleを併用しないでください。

台詞や声を指定できますか?

プロンプトで発話の意図を指定できます。リファレンスモードでは、映像メディアと組み合わせた参照音声から声質を導けます。選んだ動画尺で無理なく話せる短さにしてください。

正確なAPIフィールドはどこで確認できますか?

contentのrole、duration、ratio、statusの扱いは、本サイトのMiniMax H3 APIガイドとMiniMax公式V2ドキュメントで確認してください。

指示書から動きへ

明確なMiniMax H3ショットをひとつ書き、演出を試す。

モードから始め、役に立つカメラの判断をひとつ加え、複雑さを増やす前に結果を比較しましょう。

MiniMax H3

映像表現の意図をかたちにすることに特化した、独立運営の動画生成体験です。

MiniMax H3 は独立して運営されているプロダクト体験であり、MiniMax との提携や同社による推奨を受けたものではありません。本サイトは公式の MiniMax H3 API には接続しておらず、決済機能も提供していません。

© 2026 MiniMax H3
MiniMax H3 プロンプトガイド | 動画テンプレート