MiniMax H3のプロンプト例文集|コピペで使えるカメラワーク・日本語セリフ・音声指定

MiniMax H3のプロンプト例文集|コピペで使えるカメラワーク・日本語セリフ・音声指定 MiniMax H3

MiniMax H3で動画を生成しても、「人物が少し動くだけで終わる」「カメラが固定されたままになる」「日本語のセリフや音声をどう指定すればよいのか分からない」と悩むことがあります。

原因のひとつは、動画で起こしてほしい出来事と、カメラや音声の指示が十分に分かれていないことです。

画像生成のように見た目だけを説明するのではなく、「何が映るのか」「時間とともに何が起きるのか」「カメラがどう動くのか」「何が聞こえるのか」まで整理すると、プロンプトを調整しやすくなります。

MiniMax H3は映像とステレオ音声を一緒に生成でき、公式のPrompt Writing Guideでも、映像・動作・会話、環境音、観客向けのBGMを役割別に整理する形式が案内されています。

この記事では、まずそのまま使える基本例を紹介し、人物、カメラワーク、日本語セリフ、環境音、BGMの書き方を順番に解説します。

さらにT2V、I2V、First / Last Frame、R2Vで何を書き換えればよいのか、思い通りにならないときにどこを修正すればよいのかまで分かります。

最初から長いプロンプトを完成させようとする必要はありません。

まず基本例をコピーし、人物や場所を変えて1本生成してから、必要な要素を少しずつ加えていきましょう。

  1. まずコピペ|MiniMax H3プロンプトの基本テンプレート
    1. 基本は「画風・場所・人物・動作・カメラ・音声」の6要素
    2. 完成例|人物・カメラ・日本語セリフ・環境音・BGMまで指定する
    3. 例文ではこの6か所を書き換えれば自分の動画に使える
  2. コピペで使えるMiniMax H3のプロンプト例文
    1. 人物が自然に歩くシネマティック動画のプロンプト例
    2. 日本語で会話する人物動画のプロンプト例
    3. 商品を見せるCM・物撮り動画のプロンプト例
    4. 映画のような風景・情景動画のプロンプト例
    5. 複数Shotで場面を切り替える短編動画のプロンプト例
  3. カメラワークを指定すると動画の見せ方を変えられる
    1. Push・Pull・Pan・Truck・Tilt・Trackingの違い
    2. カメラの速度と移動量まで書くと動きを具体化できる
    3. Shotを増やすときは「新しい情報があるカット」にする
  4. 日本語セリフ・環境音・BGMをプロンプトで指定する方法
    1. 日本語セリフは「誰が・どんな声で・何を話すか」を分けて書く
    2. 環境音・効果音はoverall_soundscapeで整理する
    3. BGMはnon_diegetic_musicで楽器・テンポ・変化を指定する
  5. T2V・I2V・R2Vではプロンプトの書き方を変える
    1. T2Vは人物・場所・構図までテキストで具体的に決める
    2. I2Vは画像の説明を繰り返すより「これから何が起きるか」を書く
    3. First / Last Frameでは最初と最後の間をどう動かすかを書く
    4. R2VではPicture・Video・Audioの「何を参照するか」を明確にする
  6. MiniMax H3で思い通りにならないときのプロンプト改善方法
    1. 人物がほとんど動かないときは動作の途中経過を書く
    2. カメラワークが反映されないときは1 Shotの指示を減らす
    3. セリフが不自然なときは話者と声の条件を明確にする
    4. R2Vで参照が混ざるときは素材ごとの役割を1つずつ明示する
  7. MiniMax H3のプロンプトでよくある質問
    1. プロンプトは日本語と英語のどちらで書けばいい?
    2. プロンプトは長いほど高品質になる?
    3. 1本の動画にShotをいくつ入れればいい?
  8. まとめ|まず基本例文をコピペして1項目ずつ変えてみよう

まずコピペ|MiniMax H3プロンプトの基本テンプレート

MiniMax H3のプロンプトは、初心者であれば「画風→場所→人物→動作→カメラ→音声」の順で考えると整理しやすくなります。

これはプロンプトを組み立てるための簡易的な考え方です。

実際の公式Prompt Writing Guideでは、映像・動作・Shot・会話などを「integrated_multimodal_description」、環境音や物理的な動作音を「overall_soundscape」、登場人物には聞こえないBGMを「non_diegetic_music」として整理しています。

MiniMax H3をComfyUIへまだ導入していない場合は、先にMiniMax H3をComfyUIで使う方法で通常の生成ワークフローを準備しておくと、この記事の例文をすぐ試せます。

基本は「画風・場所・人物・動作・カメラ・音声」の6要素

MiniMax H3のプロンプトを書くときは、最初に動画全体の画風を決めます。

たとえばCinematic、live-action、2D-animated、3D CGなどです。

次に場所、時間帯、光の状態を決め、その空間のどこに人物や被写体がいるのかを具体化します。

そのうえで、「女性が立っている」だけではなく、「女性がテーブルから立ち上がり、入口を振り返ってから歩き出す」のように時間変化を含む動作を書きます。

続いてMedium shot、Close-upなどの距離と、Push In、Tracking Shotなどのカメラ移動を追加します。

最後に必要であればセリフ、足音、風、雨、車などの環境音、BGMを指定します。

すべてを細かく書けばよいわけではありません。

動画で重要な要素を具体化し、優先度が低い要素は省くほうが、あとから原因を切り分けやすくなります。

公式ガイドでも、最初のShotではスタイル、初期構図、人物や場所を示し、時間軸に沿って視覚・動作・音声情報を書く形が示されています。

完成例|人物・カメラ・日本語セリフ・環境音・BGMまで指定する

まずは、人物、動作、カメラ、日本語セリフ、環境音、BGMまで入れたMiniMax H3のプロンプト例文を見てみましょう。

そのままコピーして、人物や場所だけ変更して試せます。

integrated_multimodal_description: [Shot 1] Live-action, cinematic. A medium shot frames a young Japanese woman in a beige coat standing outside a small café on a quiet city street at dusk. Warm light spills from the café windows onto the wet pavement. She looks toward the entrance, takes a few natural steps forward, and gently brushes a strand of hair away from her face as her coat and hair move slightly in the evening breeze. The camera pushes in with small amplitude at slow speed while following her movement. The young woman with a soft, clear voice and a calm speaking pace (S1) smiles slightly and says: <d>[Japanese] ここ、ずっと来てみたかったんだ。</d> She reaches for the café door and begins to open it.

overall_soundscape: Soft footsteps on damp pavement, distant city traffic, a light evening breeze, and the subtle rustle of her coat. The café door handle clicks softly as she reaches for it.

non_diegetic_music: Gentle piano notes at a slow tempo with soft sustained strings, remaining low in volume and gradually fading toward the end.

この例では、最初に画風とMedium shotを決め、その後に人物、場所、動作を書いています。

さらにカメラは「Push Inする」だけでなく、small amplitudeとslow speedを加えて、移動量と速度を限定しています。

MiniMax H3の公式ガイドでは、日本語を含む11言語の会話が安定対応言語として挙げられており、話者にはS1やS2などのIDを付け、セリフ本文は言語タグとともに分離する形式が示されています。

まずはこの例をそのまま試し、生成できたら人物、場所、動作のうち1~2か所だけを変えてみてください。

最初からカメラや音声まで全部書き直すより、変更した部分と生成結果の関係を確認しやすくなります。

例文ではこの6か所を書き換えれば自分の動画に使える

コピペした例文を自分用に変えるときは、画風、場所、人物・被写体、動作、カメラ、セリフ・音声の6か所を確認します。

たとえば「Live-action, cinematic」をアニメ調に変更し、「夕方のカフェ前」を「朝の駅前」に変えるだけでも映像の方向性は大きく変わります。

さらに人物を男性や子どもへ変えたり、「カフェへ入る」を「駅へ向かって走り出す」に変更したりすれば、同じ骨格のまま別の動画を作れます。

ただし、一度に6項目すべてを変えると、失敗したときに原因が分かりにくくなります。

最初は人物、場所、動作を変更して生成し、次にカメラ、最後にセリフや音声を加える流れがおすすめです。

コピペで使えるMiniMax H3のプロンプト例文

ここからは用途別のMiniMax H3プロンプト例文を紹介します。

完成形をベースにしているため、理論から作り直す必要はありません。

自分の作りたい動画に近い例を選び、人物、商品、場所、動作などを置き換えて使ってください。

人物が自然に歩くシネマティック動画のプロンプト例

人物を自然に歩かせたい場合は、「walks」と書くだけで終わらせず、歩き始める前後の動きや髪、服、持ち物の変化まで含めるのがポイントです。

integrated_multimodal_description: [Shot 1] Live-action, cinematic. A medium-wide shot shows a young woman in a long dark coat standing at the entrance of a narrow old city street shortly after sunset. She glances down the street, shifts her weight forward, and begins walking at a relaxed pace. Her arms swing naturally with each step, the hem of her coat moves gently, and loose strands of hair sway in the breeze. The camera performs a Tracking Shot beside her at a steady pace, keeping her upper body and surrounding storefronts in frame. She briefly looks toward a glowing shop window before continuing forward.

overall_soundscape: Rhythmic footsteps on stone pavement, distant traffic, low city ambience, occasional bicycle sounds, and light fabric movement from the coat.

non_diegetic_music: N/A

「人物が歩く」という主動作に対して、腕、コート、髪といった二次的な動きを加えています。

Tracking Shotで人物を追えば、被写体だけが動いてカメラが置き去りになる構図も避けやすくなります。

落ち着いた日常映像ならBGMをN/Aにし、足音や街の音だけで構成する方法もあります。

映画的な印象を強めたい場合は、低音量のピアノやストリングスなどをnon_diegetic_musicへ追加します。

日本語で会話する人物動画のプロンプト例

日本語会話では、セリフだけを書くのではなく「誰が話すか」「どんな声か」「どのように話すか」を分けると整理しやすくなります。

複数人の場合はS1とS2を途中で入れ替えないことも重要です。

integrated_multimodal_description: [Shot 1] Live-action, cinematic. A medium two-shot frames a young Japanese woman (S1) and a young Japanese man (S2) sitting across from each other at a quiet wooden table inside a small café. S1 has a soft, slightly bright voice and speaks at a natural pace. She lifts her coffee cup, looks at S2, smiles, and says: <d>[Japanese] 今日、思ったより早かったね。</d> S2 has a calm, lower-pitched voice and answers with a small laugh: <d>[Japanese] うん、電車がちょうど来たんだ。</d> The camera slowly pushes in toward the two speakers while their facial expressions remain relaxed and their lip movements follow the conversation.

overall_soundscape: Low café ambience, soft clinks of cups and dishes, distant conversation, a coffee machine operating briefly in the background, and subtle chair and clothing sounds.

non_diegetic_music: N/A

公式Prompt Writing Guideでは、声を出す人物にはS1、S2のような安定したIDを与え、話者の特徴や話し方をセリフの外側へ、実際に話す内容を<d>内へ置く形式が示されています。

会話が不自然な場合は、セリフを増やすより、まず1人ずつ短く話させて確認するほうが調整しやすくなります。

商品を見せるCM・物撮り動画のプロンプト例

商品動画では、商品そのものを激しく動かすより、ライトの反射とカメラ移動によって立体感を見せる方法が使いやすくなります。

integrated_multimodal_description: [Shot 1] Live-action, premium commercial style. A close-up shows a matte black cylindrical perfume bottle standing upright on a dark reflective surface against a clean charcoal background. A narrow soft light moves across the curved glass, revealing subtle reflections while the bottle keeps its original proportions and shape. The camera performs a slow Arc Shot around the product with small amplitude, maintaining sharp focus on the bottle. Near the end, the camera gently pushes in toward the cap and upper glass surface as a thin highlight travels along the edge.

overall_soundscape: A subtle soft mechanical movement sound and a light glass contact tone at the beginning, with an otherwise clean studio soundscape.

non_diegetic_music: Minimal electronic pulses at a slow tempo with sparse low-frequency tones, gradually increasing slightly in volume before ending cleanly.

商品名やロゴの正確な文字表現は、商品そのものの形やカメラワークとは別の課題です。

プロンプトへ大量の文字情報を詰めるより、まず商品形状、素材、背景、照明、カメラを安定させ、その後に必要な要素を追加すると調整しやすくなります。

映画のような風景・情景動画のプロンプト例

風景では「美しい森」「映画のような湖」だけで終わらせず、時間帯、天候、光、前景・中景・背景、自然物の動きを決めます。

integrated_multimodal_description: [Shot 1] Cinematic landscape. A wide shot overlooks a quiet mountain lake shortly after sunrise. Wet grass and dark rocks occupy the foreground, a thin layer of mist drifts slowly across the middle of the lake, and pine-covered mountains rise in the background. Pale golden sunlight breaks through low clouds and creates narrow reflections across the water. Small ripples move toward the shore while nearby grass bends gently in the wind. The camera slowly trucks right with small amplitude, revealing more of the mist-covered shoreline without changing the calm pacing of the scene.

overall_soundscape: Gentle wind moving through grass and pine trees, quiet water lapping against stones, distant birds, and occasional drops of water falling from wet branches.

non_diegetic_music: Sparse piano notes with sustained cello and low strings at a slow tempo, remaining restrained and gradually fading at the end.

風景動画では、画面内に複数の速度があると静止画のような印象を減らせます。

霧はゆっくり流れ、水面には小さな波があり、手前の草が風で揺れる、といったように自然な変化を重ねるイメージです。

複数Shotで場面を切り替える短編動画のプロンプト例

複数Shotを使う場合は、カットするたびに新しい情報を見せることが大切です。

公式ガイドでは最初のShotにはタイムスタンプを付けず、後続Shotへ動画時間内のCut時刻を入れる形式が示されています。

integrated_multimodal_description: [Shot 1] Live-action, cinematic. A wide shot shows a young woman in a dark blue coat standing alone on a quiet train platform at night. She looks down the tracks as distant headlights appear through light rain. Her coat and hair move slightly in the wind.

[Shot 2] At 00:03.500, the camera cuts to a medium shot from the side as the train approaches the platform. She takes one step back from the edge and grips the strap of her bag while reflected lights move across her face.

[Shot 3] At 00:06.500, the camera cuts to a close-up of her face as the train slows beside her. She looks toward the opening doors and quietly says: <d>[Japanese] やっと来た。</d>

overall_soundscape: Light rain, wind across the open platform, the distant metallic sound of the approaching train growing louder, braking noise, and a soft electronic door signal.

non_diegetic_music: Low sustained strings at a slow tempo, gradually increasing in volume as the train approaches and fading after the final line.

Wide shotでは「どこにいるのか」を見せ、Medium shotでは列車と人物の関係を見せ、Close-upでは表情とセリフを見せています。

カメラ距離が少し変わるだけなら、すぐCutを増やす必要はありません。

Push InやPull Outでつなげられる場合は、1 Shotのまま動かしたほうが自然なこともあります。

カメラワークを指定すると動画の見せ方を変えられる

MiniMax H3のプロンプトでは、人物の動きとカメラの動きを分けて考えると映像を設計しやすくなります。

「女性が前へ歩く」は被写体の動きですが、「カメラが女性を横から追う」はTracking Shotです。

公式Prompt Writing Guideではカメラ移動をMotion Type、Amplitude、Speedという3つの観点で整理し、必要に応じて移動量と速度を自然な英文へ組み込む方法が示されています。

Push・Pull・Pan・Truck・Tilt・Trackingの違い

Push Inはカメラ自体が被写体へ近づく動きです。

人物の表情や商品の細部へ注目させたい場面で使いやすく、「The camera slowly pushes in toward her face.」のように指定します。

Pull Outは反対にカメラが後方へ離れます。

最初は人物を大きく見せ、徐々に周囲の場所まで見せたい場面に向いています。

Pan LeftとPan Rightは、カメラの位置をほぼ変えず、レンズの向きを左右へ振る動きです。

画面外にある人物や建物を見せたいときに使えます。

Truck LeftとTruck Rightはカメラ自体が横方向へ移動します。

Panと似ていますが、背景との位置関係が変わるため、立体感のある横移動を作りたい場合に向いています。

Tilt UpとTilt Downは、カメラ位置を大きく変えずに上下へ向きを変える動きです。

人物の足元から顔まで見せたり、高い建物を下から上へ見せたりする場面で使えます。

Pedestal UpとPedestal Downは、レンズを上下へ振るのではなく、カメラ本体が上下へ移動します。

Arc Shotは被写体の周囲を円弧状に移動するため、商品や人物を立体的に見せたい場合に便利です。

Tracking Shotは移動している被写体を追います。

歩く人物、走る車、自転車など「被写体の移動を継続して見せたい場面」と相性があります。

Static Shotはカメラ位置とレンズを固定する指定です。

人物の演技だけを見せたい場面では、無理にカメラを動かさない選択肢もあります。

POVは被写体自身の視点から見た映像です。

ドアを開ける、道を歩く、手元を見るといった体験型の映像に使えます。

Zoom InとPush Inも混同しやすい表現です。

Zoom Inはカメラ本体がその場にあり、焦点距離の変化によって画面上の被写体を大きくします。

Push Inはカメラ自体が前へ進むため、被写体と背景の見え方も変わります。

これらの動きは公式ガイドでも個別のカメラモーションとして整理されています。

カメラの速度と移動量まで書くと動きを具体化できる

「Push In」とだけ書いてイメージより大きく動いた場合は、移動量と速度を追加します。

ゆっくり少しだけ寄るなら「The camera pushes in with small amplitude at slow speed toward her face.」と書けます。

大きく素早く横へ移動するなら「The camera pans right with large amplitude at fast speed, revealing the doorway.」のようにします。

公式ガイドではsmall amplitude、large amplitude、slow speed、fast speedなどの表現が示されており、通常の移動量と速度でよい場合は必ずしも追加する必要はありません。

重要なのは、細かい指定を増やすことではなく、意図と違った部分だけ具体化することです。

1つのShotへPush In、Pan、Tilt、Arc Shotなどを一度に詰め込むと、どの動きを優先するのか分かりにくくなります。

最初は主役となるカメラ移動を1つに絞り、必要な場合だけ補助的な動きを追加すると調整しやすくなります。

Shotを増やすときは「新しい情報があるカット」にする

Shotを分ける目安は、被写体、視点、空間、状態、時間のいずれかが変化するときです。

駅の外観からホームの人物へ切り替わるなら空間と被写体の情報が変わります。

人物の全身から手元の手紙へ切り替えるなら、視点と注目対象が変わります。

一方、人物へ少し近づくだけなら、Close-upへCutするのではなくPush Inで見せる方法があります。

公式ガイドでも、Cutでは新しい情報を追加し、距離やわずかな角度だけを変えたい場合はカメラ移動を優先する考え方が示されています。

複数Shotを使う場合は、たとえば「[Shot 2] At 00:03.500, the camera cuts to…」のようにCut位置を指定します。

ただし、短い動画だからといって無理に3~4Shotへ分割する必要はありません。

1 Shotで成立する場面なら、カメラ移動と人物の動きだけで見せるほうが分かりやすい場合もあります。

日本語セリフ・環境音・BGMをプロンプトで指定する方法

MiniMax H3では、映像だけでなくステレオ音声も生成できます。

音声を指定するときは、人が話すセリフ、足音などの効果音、雨や街などの環境音、BGMを同じものとして扱わないことがポイントです。

映像と同期して実際の空間で鳴る音と、登場人物には聞こえず視聴者だけに聞こえるBGMを分けて書きます。

日本語セリフは「誰が・どんな声で・何を話すか」を分けて書く

日本語セリフでは「日本語で『おはよう』と言う」とだけ指定するより、話者、声質、速度、感情、実際のセリフを分けます。

たとえば次のように書けます。

The young Japanese woman with a clear, gentle voice and a relaxed speaking pace (S1) looks toward the camera, smiles softly, and says: <d>[Japanese] おはよう。今日は少し早く来たんだ。</d>

声を低くしたい場合はlow-pitched、息を含んだ静かな声ならquiet, breathy voiceなど、聞こえる特徴を追加します。

複数人が話す場合は、最初に割り当てたS1とS2を最後まで維持します。

公式Prompt Writing Guideでは、話者IDや声の特徴を<d>の外側に置き、<d>内には言語タグと実際の発話内容を入れ、元のセリフを翻訳・書き換えず保持する形式が示されています。

2人以上の会話が崩れる場合は、一度に長い掛け合いを作るより、S1が短く話し、次にS2が返す形から始めると原因を切り分けやすくなります。

環境音・効果音はoverall_soundscapeで整理する

雨、風、足音、車、ドア、食器、衣擦れなど、シーン全体で聞こえる環境音や物理的な動作音はoverall_soundscapeへまとめます。

たとえば雨の日のカフェなら、次のように書けます。

overall_soundscape: Steady rain taps against the café windows while low room ambience continues underneath. Ceramic cups clink softly in the background. The entrance bell rings once, followed by wet footsteps and the subtle scrape of a chair.

「cinematic sound」のように雰囲気だけを指定するより、実際に何が聞こえるのかを書いたほうが内容を調整しやすくなります。

人物が歩くなら足音、ドアを開けるならハンドルやヒンジ、雨が降っているなら窓や地面へ当たる雨音というように、映像内の動作と対応させて考えます。

公式ガイドではoverall_soundscapeを、環境音、物理的な動作音、非言語的な人間の音などを動画全体にわたって整理する部分としています。

BGMはnon_diegetic_musicで楽器・テンポ・変化を指定する

視聴者だけに聞こえるBGMはnon_diegetic_musicへ書きます。

「悲しいBGM」「感動的な曲」のような抽象的な雰囲気だけでなく、楽器、速度、リズム、音量変化、終わり方を具体化します。

たとえば次のように書けます。

non_diegetic_music: Sparse piano notes at a slow tempo, joined by sustained low strings. The strings gradually increase in volume during the middle of the shot before both instruments fade out gently at the end.

ピアノを中心にするのか、ストリングスを重ねるのか、テンポを速くするのか、最後にフェードアウトするのかを書けば、自分が変えたい部分も分かりやすくなります。

BGMが不要なら「non_diegetic_music: N/A」とします。

一方、店内のラジオやスマートフォンから流れている曲など、登場人物自身にも聞こえている音楽はnon_diegetic_musicとは異なります。

公式ガイドでは、そのような劇中で実際に鳴っている音楽は映像・音声タイムライン側へ含め、non_diegetic_musicは登場人物には聞こえない視聴者向け音楽として分けています。

T2V・I2V・R2Vではプロンプトの書き方を変える

MiniMax H3では、テキストだけで始める場合と、画像や動画、音声などの参照素材を渡す場合で、プロンプトの重点が変わります。

現在の公式Prompt Writing GuideではT2VA、I2VA、FL2VA、L2VA、Ref2VAを分けて扱っており、API側でもText-to-Video、First/Last-Frame Image-to-Video、Reference Generationなどのモードが案内されています。

T2Vは人物・場所・構図までテキストで具体的に決める

T2Vでは参照画像がないため、最初の画面に何が映っているのかをテキストで決める必要があります。

画風だけでなく、人物の外見、場所、時間帯、初期構図、位置関係など、動画開始時に必要な視覚情報を省略しすぎないことがポイントです。

integrated_multimodal_description: [Shot 1] Live-action, cinematic. A medium-wide shot frames a young Japanese man wearing a dark green jacket and black trousers beside a small roadside ramen shop at night. Red and white lantern light reflects on the wet pavement. He looks toward the entrance, places one hand in his jacket pocket, then takes two steps toward the shop. The camera slowly pushes in with small amplitude. He looks at the menu beside the door and says in a quiet, natural voice (S1): <d>[Japanese] ここにしよう。</d>

overall_soundscape: Light traffic, distant voices, soft footsteps on wet pavement, a faint ventilation fan from the restaurant, and occasional water dripping from the roof.

non_diegetic_music: N/A

T2Vでは「誰が、どこで、どのように始まり、何をするか」をプロンプトだけで成立させます。

公式ガイドでもT2VAはテキストから映像と音声のタイムライン全体を構築するモードとして説明されています。

I2Vは画像の説明を繰り返すより「これから何が起きるか」を書く

I2Vでは、入力画像がすでに開始時点の人物、服装、色、構図、場所などを持っています。

そのため、画像にある情報を最初から長々と説明するより、画像を起点として「次に何が起きるのか」を具体化することが重要です。

For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.

integrated_multimodal_description: [Shot 1] Live-action, cinematic. The young woman shown in <Picture 1> remains in the same position, clothing, lighting, and surrounding environment established by the first frame. She slowly raises her gaze toward the window, turns her head slightly to the right, then lifts the coffee cup in front of her. Steam continues to rise as the camera trucks right with small amplitude at slow speed. She takes a small sip and gently lowers the cup back toward the table.

overall_soundscape: Quiet room ambience, light rain against the window, a soft ceramic cup sound, and subtle fabric movement.

non_diegetic_music: N/A

公式ガイドではI2VAについて、first-frame anchorからaction onset、continuous development、result or reactionへ進む流れが示されています。

つまり、入力画像を再説明すること自体を目的にするのではなく、その状態を保ちながらどんな動きが始まり、どう変化し、最終的にどうなるのかを書くイメージです。

画像接続やFirst / Last Frame側のComfyUIワークフローを別記事で扱っている場合は、ここからMiniMax H3のI2V・First / Last Frame導入記事へつなげると操作手順まで確認できます。

First / Last Frameでは最初と最後の間をどう動かすかを書く

First / Last Frameでは、開始画像と終了画像の両方があるため、重要なのは2枚の画像を別々に説明することではありません。

最初の状態から最後の状態へ、何がどのように変化するのかを書きます。

How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video.

integrated_multimodal_description: [Shot 1] Live-action, cinematic. The woman begins in the pose and framing established by Picture 1, holding a closed black umbrella beside her body. The camera slowly pulls out with small amplitude as she raises the umbrella, slides the runner upward, and opens the canopy. She takes one step forward, rotates the umbrella handle slightly, and gradually settles into the body position, object placement, camera framing, and final composition established by Picture 2.

overall_soundscape: Steady rain, soft footsteps, the metallic click of the umbrella mechanism, and the brief snap of the canopy opening.

non_diegetic_music: N/A

公式ガイドではFL2VAについて、開始状態、中間で観察できる変化、終了フレームとの差が徐々に縮まる過程、最後の状態という流れが示されています。

また、連続的な補間が重要なため、明確な理由がなければ1 Shotを優先する考え方も案内されています。

R2VではPicture・Video・Audioの「何を参照するか」を明確にする

R2Vでは参照素材を増やすことより、それぞれから何を引き継ぎたいのかを明確にすることが重要です。

たとえばPicture 1から人物の外見、Video 1から動作やカメラの流れ、Audio 1から声質を参照するというように役割を分けます。

MiniMax H3のReference Generationは画像、動画、音声を参照でき、公式APIでもキャラクター、動き、カメラ、スタイル、声、編集リズムなどを参照する用途が案内されています。

たとえば次のような考え方です。

Use <Picture 1> as the visual reference for <Subject 1>, preserving the subject’s facial appearance, hairstyle, clothing, and overall identity. Use <Video 1> as the motion reference for <Subject 1>, following the walking rhythm, body movement, and camera tracking pattern without replacing the subject’s appearance. Use <Audio 1> as the voice reference for <Subject 1>.

integrated_multimodal_description: [Shot 1] Live-action, cinematic. <Subject 1> appears with the visual identity referenced from <Picture 1> and walks through a quiet evening street using the natural walking motion and camera-following rhythm referenced from <Video 1>. The camera maintains a medium Tracking Shot beside the subject. <Subject 1> briefly turns toward the camera and speaks in the voice characteristics referenced from <Audio 1>: <d>[Japanese] もう少しだけ歩こう。</d>

overall_soundscape: Natural footsteps, light city ambience, distant traffic, and subtle clothing movement.

non_diegetic_music: N/A

R2Vで参照結果が混ざる場合は、「Picture 1、Video 1、Audio 1を参照する」とだけ書くのではなく、Pictureは外見、Videoは動き、Audioは声というように目的を限定します。

R2Vのノード構成や素材の接続方法まで確認したい場合は、MiniMax H3 R2Vワークフロー実践ガイドで実際のワークフローとあわせて確認してください。

まずはPicture 1だけで外見を固定し、生成結果を確認してからVideo、Audioを追加すると、どの参照素材が結果へ影響しているのか判断しやすくなります。

MiniMax H3で思い通りにならないときのプロンプト改善方法

プロンプト例文を使っても、毎回意図した結果になるとは限りません。

その場合は全文を書き直すのではなく、人物、動作、カメラ、音声、参照素材のどこに問題があるのかを分けて考えます。

1回のテストで変更する変数を減らすと、改善につながった指定を見つけやすくなります。

人物がほとんど動かないときは動作の途中経過を書く

人物がほとんど動かない場合は、「walks」「stands up」のように動作名だけで終わっていないか確認します。

たとえば「人物が歩く」を、「椅子から立ち上がる。入口へ顔を向ける。右足を前へ出して歩き始める。腕が歩行に合わせて自然に揺れ、コートの裾も動く。最後にドアの前で立ち止まる」と時間変化へ分解します。

動作の開始、途中、結果まで書けば、何を映像化してほしいのかが具体的になります。

髪、服、腕、バッグなど、主動作に伴って自然に動く部分も加えられます。

ただし、「歩きながら走り、振り返り、ジャンプし、スマートフォンを操作する」のように短時間へ多数の行動を詰め込むと、指示同士が競合しやすくなります。

最初は主動作を1つ決め、必要な補助動作だけを追加してください。

カメラワークが反映されないときは1 Shotの指示を減らす

カメラが思い通りに動かない場合は、カメラ用語を追加する前に現在の指示を減らします。

1 Shotの中へPush In、Pan Right、Tilt Up、Arc Shot、Tracking Shotまで同時に入れているなら、まず最も重要な1つへ絞ります。

人物を歩きながら追いたいならTracking Shot、表情へ近づきたいならPush Inというように目的から選びます。

動きが大きすぎる場合はwith small amplitude、速すぎる場合はat slow speedを追加します。

逆に動きが弱い場合はlarge amplitudeやfast speedが使える場面もあります。

公式ガイドでも、カメラ移動はMotion Typeを中心に、必要な場合のみAmplitudeとSpeedを追加し、自然な文章としてShot内に組み込む形式が示されています。

セリフが不自然なときは話者と声の条件を明確にする

セリフがおかしい場合は、まず誰が話しているのかを明確にします。

2人いるのにSpeaker IDがない場合や、途中でS1とS2の人物が入れ替わっている場合は整理します。

次に年齢感、声の高さ、声質、話す速度など、本当に必要な条件だけを追加します。

たとえば「女性が話す」ではなく、「The young Japanese woman with a soft, clear voice and a natural speaking pace (S1) says:」のようにします。

その後に<d>[Japanese] ...</d>で実際のセリフを分けます。

会話が長すぎる場合は短くすることも有効です。

まず1人1文程度で成功するかを確認してから、発話量を増やします。

R2Vで参照が混ざるときは素材ごとの役割を1つずつ明示する

R2Vで別の画像の顔が混ざる、動画の動きを参照したら外見まで変わる、といった場合は素材の役割を整理します。

Pictureは人物の外見、Videoは動きやカメラ、Audioは声というように、何を保持するのかを明示します。

同じ人物に割り当てたSubject IDを途中で変更しないことも大切です。

参照素材を多く指定するほど必ず安定するわけではありません。

必要性の低い素材を一度外し、Pictureだけ、Picture+Video、Picture+Video+Audioという順に追加すれば、問題のある参照関係を見つけやすくなります。

より複雑な参照設定はMiniMax H3 R2Vワークフロー実践ガイドで確認し、本記事では「どの素材から何を使うか」というプロンプト側の整理を優先してください。

MiniMax H3のプロンプトでよくある質問

最後に、MiniMax H3のプロンプトを書くときに迷いやすい言語、長さ、Shot数について整理します。

プロンプトは日本語と英語のどちらで書けばいい?

日本語では生成できないと考える必要はありません。

一方、現在の公式Prompt Writing Guideで示されている構造化プロンプトは英語を基本としており、セリフや画面内テキストなどは元の言語を保持する形式です。

この記事では再現しやすい形として、映像やカメラなどの構造部分を英語、日本語で話してほしいセリフを[Japanese]として記述しています。

迷う場合は、まず記事内の例文をそのまま使い、人物、場所、動作、日本語セリフだけを変更してみてください。

プロンプトは長いほど高品質になる?

長さそのものを増やしても、必ず高品質になるとは限りません。

重要なのは、画面に見えるもの、時間とともに起こること、聞こえるものが具体的で、指定同士に大きな矛盾がないことです。

「beautiful」「amazing」「cinematic」など似た形容詞を大量に並べるより、人物がどう動き、カメラがどこへ移動し、何が聞こえるのかを書くほうが修正にも使えます。

長くする場合は、形容詞を増やすのではなく、動作の途中経過、必要なShot、カメラ移動、環境音など、生成結果に影響させたい情報を追加してください。

なお、現在のMiniMax H3公式APIではプロンプト長の上限が7,000文字と案内されています。

1本の動画にShotをいくつ入れればいい?

決まった正解はありません。

短い動画でも、新しい視点や場面が必要なら複数Shotを使えますが、1 Shotだけで成立する動画もあります。

人物を少しアップにするだけならCutではなくPush Inで十分な場合があります。

場所、時間、視点、被写体、状態などが変わり、新しい情報を見せたいときにShotを追加すると考えると判断しやすくなります。

特にFirst / Last Frameのように開始状態から終了状態への連続性が重要な場合は、公式ガイドでも基本的に単一Shotを優先する考え方が示されています。

まとめ|まず基本例文をコピペして1項目ずつ変えてみよう

MiniMax H3のプロンプトは、最初からすべての要素を完璧に書こうとするより、基本例をコピーして段階的に変更するほうが調整しやすくなります。

まず人物、場所、動作を書き換えて1本生成します。

次にTracking ShotやPush Inなど、目的に合うカメラワークを1つ追加します。

会話が必要なら話者と声の特徴を決めて日本語セリフを追加し、最後に環境音やBGMを整えます。

T2Vでは初期構図や人物までテキストで具体化し、I2Vでは入力画像の先で何が起きるのか、First / Last Frameでは開始から終了までの変化、R2VではPicture・Video・Audioから何を参照するのかを明確にすることがポイントです。

結果が思い通りでない場合も、プロンプトをすべて書き換える必要はありません。

人物の動作だけ、カメラだけ、音声だけというように1項目ずつ変更すれば、改善につながった条件を残しやすくなります。

PromptやSeedを何度も比較しながら検証したい場合は、MiniMax H3 Turbo LoRAをComfyUIで検証でプレビュー生成を高速化する方法も確認してみてください。

まずは冒頭の完成例をコピーし、人物・場所・動作の3か所だけ自分の動画に合わせて変更して1本生成してみましょう。

コメント