キーワードの雲より、再生順
5つの美的方向と3つのカメラワークを同時に選ばせると、ショットはまとまりにくくなります。視聴者が実際に目にする順番で判断事項を並べましょう。
役に立つMiniMax H3プロンプトは、雰囲気を並べただけのムードボードではありません。ひとつのショットに、明確な被写体、読み取れる舞台、制御された動き、カメラの軌道、必要に応じた音の意図、ラストを与え、中心となる動作と競合する指示を取り除きます。
再生される順番で決定事項を書きます。中心となる動きがひとつ、明確なカメラの軌道がひとつあるほうが、矛盾する指示を重ねるより意図が伝わります。
MiniMax H3は、シーン全体の考案、固定したフレームのアニメーション、開始画像と終了画像の橋渡し、オムニリファレンスの反映に対応します。この組み合わせを安全に導くには、シーン、被写体、動作、カメラ、音の意図、ラストを再生順に並べた短い制作指示が効果的です。
5つの美的方向と3つのカメラワークを同時に選ばせると、ショットはまとまりにくくなります。視聴者が実際に目にする順番で判断事項を並べましょう。
テキストのみなら世界全体を考案し、開始フレームなら既知の世界を動かし、リファレンスなら信号を引き継ぎます。選んだ仕事に合う書き方をします。
見た目が似ていても、モデルに任せる仕事は異なります。文章を磨く前にモードを選びましょう。
被写体、環境、冒頭の構図をMiniMax H3に文章から考案させる場合に使います。テキストのみのモードではratioが必須です。
[動画尺とアスペクト比]。[特徴が分かる被写体]が[具体的な場所と時間帯]にいる。動画を通して[中心となる動作や変化]。カメラは[軌道とフレーミングの変化]。[光、色調、素材感、空気感]。必要なら[台詞や音の意図]。最後は[最終構図や感情の余韻]で終える。開始フレームですでに人物・物の特徴、構図、最初の美的方向が決まっている場合に使います。
画像内の[主な被写体]が[ひとつの明確な動作]をする。[環境や副要素の変化]。被写体の特徴と元のビジュアルスタイルを保ちながら、カメラは[軌道]。必要なら音:[声/環境音の手がかり]。最後は[ポーズやフレーミング]で終える。2枚のフレームを個別に説明し直すのではなく、最初の画像がどのように最後の画像へ変化するかを書きます。
開始フレームから、[被写体の動作と環境の変化]。[カメラの動きとタイミング]。構図が自然に変化して指定した終了フレームへ到達する間も、[人物・物・スタイルの制約]を維持する。スタイルを形容する前に、各リファレンスの役割を決めます。referenceのroleと開始・終了フレームのroleは併用しません。
参照画像は[人物/商品/スタイル]に使う。参照動画は[動き/カメラ/リズム]に使う。参照音声がある場合は[声質/話し方]に使う。[シーン]で[動画尺]のショットを作成。被写体の動作:[読み取りやすいひとつの動作]。カメラ:[軌道]。参照した同一性を維持する。最後は[締めの一場面]で終える。制御に役立つときだけ詳細を加えます。形容詞を増やすほど、動きと優先度を奪い合います。
中心となる人物、商品、生き物、形を示します。外見の詳細は、見分けるために必要なものだけを加えます。
夜の路地、スタジオ、森の縁、橋の内部、様式化した世界など、被写体を具体的な環境に置きます。
動作とシーンの変化を記述します。動画に必要なのは、静的なビジュアルタグの一覧ではなく、時間とともに起きる変化です。
固定、追従、寄る、引く、上昇、パン、周回などから画角と移動を選び、組み合わせる場合は順番を明確にします。
台詞、ルームトーン、参照音声が重要なら明記します。r2vaでは、参照音声を映像メディアと組み合わせます。
表情のクローズアップ、広い風景の提示、振り向きの完了、静止した商品カットなど、ショットが落ち着く場所を示します。
MiniMax H3では4〜15秒の整数を指定できます。5秒の商品紹介と12秒の人物演技では、必要な動作密度が異なります。短い1本に三幕構成を詰め込まないようにしましょう。
似た文章でも、付与するメディアのroleによってMiniMax H3に任せる仕事が変わります。
人物・物の外見、環境、冒頭の構図に文章を使います。テキストのみの生成ではratioをadaptiveにできません。
すべての画素を説明し直す必要はありません。動き、カメラ、光の変化、維持すべき特徴を指示します。
何が動き、何が変形し、指定された両端の間でカメラがどう動くかというトランジションの筋道を書きます。
顔、衣装、動き、カメラ表現、声をどのアセットが決めるか対応づけます。同じリクエストで開始・終了フレームのroleは使いません。
メディアをアップロードするだけでは不十分です。プロンプト内で、それぞれに仕事を割り当てます。
複数の画像が競合しそうな場合は、文章で明確に指定します。
参照動画は短く、目的を絞ります。公開上限は1本につき2〜15秒です。
音声だけでは送れないため、参照画像または参照動画と組み合わせます。
混在している場合は2つのタスクに分けます。公開仕様では、両モードは相互排他です。
リファレンスの対応関係を削る前に、価値の低い形容詞を減らします。
思い描けなければ、動きが着地せず漂いやすくなります。
時間を示す言葉は、MiniMax H3が優先度を理解する助けになります。各フレームを細かく管理するのではなく、ショットの段取りに使いましょう。
最初の1秒で、誰をどこで見ているかを伝えます。開始フレームですでに状況が読める場合を除き、混乱の真ん中から始めないようにします。
中盤には、静止画ではなく動画を生成する理由になる動きを置きます。
2つのカメラ演出が必要なら、同じ優先度で重ねず、「追従してから寄る」のように順序をつけます。
最後は、表情が落ち着く、商品が静止する、広い景色が開ける、身振りが完了するなど、明確な一場面で締めます。
構造を説明するために新しく書いた作例です。情報の優先順位を保ちながら、被写体や舞台を置き換えて使えます。
被写体の動作をひとつ、カメラの軌道をひとつ、最後に感情が読める一場面を置きます。
8秒、16:9のシネマティックな夜景。反射材のジャケットを着た配達員が、雨に照らされた街の交差点を自転車で横切る。タイヤが水しぶきを上げ、濡れた道路にネオンの反射が長く伸びる。カメラは自転車と並走し、その後、集中した配達員の表情へゆっくり寄る。冷たい青の実景光に、控えめなマゼンタを加え、濡れた路面を写実的に描く。タイヤが水を切る小さな音と、遠くの交通音。最後は表情がはっきり読める斜め前からのクローズアップで終える。商品デザインは開始フレームに任せ、プロンプトでは光とカメラの動きを演出します。
腕時計を中央に保ったまま、細い暖色の光がヘアライン加工のケースを横切る。商品の後ろでは淡い霧がゆっくり動く。時計の形と暗い大理石の台を維持しながら、カメラはわずかに右へ移動する。文字盤を作り変えない。最後は文字盤全体が読み取れる、端正な斜め方向の商品カットで終える。制御された2つの構図の間で起きる変化を記述します。
開始フレームからモデルが前へ歩き、スタジオのソフトボックスが雨の街灯へ溶けるように変化する。布の動きは自然に保ち、人物の同一性を維持する。環境が指定された終了フレームへ移り変わる間、カメラはゆっくり後退する。最後はその構図に正確に重なり、姿勢が落ち着いた状態で終える。スタイルを言い換える前に、各リファレンスの役割を決めます。
参照画像は人物の顔と衣装に使う。参照動画は力の抜けた歩行リズムに使う。参照音声は暖かみのある中音域の声質に使う。ゴールデンアワーの風が吹く海沿いの遊歩道で、10秒のミディアムショットを作成。人物はカメラへ歩き、一度ほほ笑み、自由な気分を表す短い一言を話す。カメラは滑らかに後退して追従する。人物と衣装の同一性を維持する。最後は安定したミディアムクローズアップで終える。弱いMiniMax H3プロンプトの多くは、言葉が足りないのではありません。被写体、動作、モード、カメラの優先順位を明確にする必要があります。
「シネマティック、美しい、4K、ドラマティック」の代わりに、決めたシーンの中で被写体が行う、目に見えるひとつの動作を書きます。
開始フレームがある場合、意図的に変えるのでなければ、衣装や背景をゼロから作り直す説明は不要です。
顔、動き、声をどのアセットが決めるか対応づけます。役割のないリファレンスはノイズになります。
中心となる軌道をひとつ選びます。2つ目が必要なら、後半に続く動きとして順番を決めます。
ひとつのショットに、ひとつの役割を与えます。長いシークエンスは、複数の生成動画から組み立てます。
タスクを分けてください。公開されているMiniMax-H3仕様では、この2つのモード群は相互排他です。
一度は監督として、もう一度は時間の流れとしてプロンプトを読み返します。
テキストのみ、開始フレーム、開始 + 終了、オムニリファレンスから、ひとつの仕様を選びます。
カメラが動き出す前に、視聴者が何を見るべきか分かる状態にします。
結果の見た目が変わる場合は、場所、時間、天候、制作の文脈を示します。
時間を通して起きる動作、変形、表情、環境の出来事を記述します。
補助的な動きには順番をつけ、矛盾する指示を重ねません。
明確な最後の一場面があると、動きが漂わず自然に着地します。
多くのMiniMax H3ショットは自然な文章でカメラを指示できます。精密さが必要な場合も、コマンドは少なくし、順番を明確にしましょう。
truck lefttruck right視線の向きを保ちながら、カメラ自体を横へ移動します。
pan leftpan rightカメラ位置をほぼ固定し、左右へ向きを変えます。
push inpull out被写体へ物理的に近づく、または遠ざかります。
riselowerチルトさせずに、カメラ位置を上げ下げします。
tilt uptilt down視線を上または下へ回転させます。
tracking shotfollow被写体とともに移動し、読みやすいフレーミングを保ちながら背景を変化させます。
zoom inzoom out空間内を移動せず、見かけの焦点距離を変えます。
static shotlocked offカメラを固定し、人物の演技や被写体の動きで映像を見せます。
subtle handheldrestrained shake被写体の動きが読めなくならないよう、控えめに使います。
長さそのものが目的ではありません。被写体、舞台、動き、カメラの軌道、必要に応じた音の意図、ラストが分かるだけの情報を書き、中心となる動作と競合する指示を削ります。公開上限は7,000文字です。
開始フレームがすでに被写体、構図、スタイルを決めています。プロンプトでは、動き、カメラの振る舞い、環境の変化、維持すべき特徴に集中します。
スタイルの形容詞を加える前に、各リファレンスへ顔、衣装、動き、カメラのリズム、声といった役割を割り当てます。メディアは公開上限内に収め、referenceのroleと開始・終了フレームのroleを併用しないでください。
プロンプトで発話の意図を指定できます。リファレンスモードでは、映像メディアと組み合わせた参照音声から声質を導けます。選んだ動画尺で無理なく話せる短さにしてください。
contentのrole、duration、ratio、statusの扱いは、本サイトのMiniMax H3 APIガイドとMiniMax公式V2ドキュメントで確認してください。
モードから始め、役に立つカメラの判断をひとつ加え、複雑さを増やす前に結果を比較しましょう。