MiniMax H3 R2Vワークフローの使い方|ComfyUIで参照画像・動画・音声を活用

MiniMax H3

MiniMax H3のR2Vでは、参照画像・動画・音声をワークフローへ追加するだけでは十分ではありません。
重要なのは、それぞれの素材から「何を参照するのか」を決め、プロンプト内で関係を明確にすることです。

たとえば、Picture 1は人物の外見、Video 1は身体の動き、Audio 1は声というように役割を分けます。
そのうえで、プロンプト内に<Picture 1><Video 1><Audio 1>を入れ、どの情報を引き継いでほしいのかを伝えます。

最初から多数の参照素材を使う必要はありません。
この記事では人物画像1枚の最小構成から始め、動作動画、音声の順に素材を増やしながら、MiniMax H3 R2Vワークフローの使い方を解説します。

  1. MiniMax H3のR2Vとは?I2Vとの違い
    1. I2Vは画像を起点にし、R2Vは素材を参考情報として使う
    2. R2Vでは人物・動き・カメラ・声を別々に参照できる
  2. R2Vで参照できる画像・動画・音声
    1. 画像・動画・音声は用途ごとに役割を分けて使う
    2. 初心者は画像1枚から始めて素材を段階的に増やす
  3. MiniMax H3 R2Vに必要なref2vaモデルを準備する
    1. T2V・I2Vのfl2vaではなくR2V専用ref2vaを使う
    2. Diffusion Model・Text Encoder・VAEを指定フォルダへ保存する
  4. ComfyUI公式のMiniMax H3 R2Vワークフローを開く
    1. Template LibraryからMiniMax H3 R2Vを選ぶ
    2. ワークフローは入力・参照・生成・保存の4ブロックで見る
  5. まずは参照画像1枚だけでR2Vを試す
    1. 顔と外見が分かりやすい人物画像を1枚用意する
    2. 最初はPicture 1を人物の外見だけに使う
  6. Picture・Video・Audioタグと接続順の仕組み
    1. Picture・Video・Audioは素材の種類ごとに番号が付く
    2. 接続順を変えたらプロンプト内の番号も確認する
    3. タグだけでなく「何を参照するか」まで文章で指定する
  7. 参照素材ごとに人物・動き・声の役割を割り当てる
    1. 1つの参照素材には1つの主な役割を持たせる
    2. 素材・タグ・役割を表で管理すると混乱しにくい
  8. 人物画像+動作動画でR2Vする方法
    1. Picture 1は人物、Video 1は身体の動きに使う
    2. 「Picture 1の人物がVideo 1の動きをする」と関係を明示する
  9. 人物画像+動作動画+音声でR2Vする方法
    1. Audio 1は声の参照として使う
    2. Picture・Video・Audioの役割を1文ずつ明示する
  10. 参照動画からカメラワークを取り入れる方法
  11. ref_image_sizeのmatchとmaxの違い
    1. 最初はmatchで速度と結果を確認する
    2. 人物が似ない場合にmaxを比較する
  12. R2Vの解像度設定と2Kの注意点
    1. 最初は公式テンプレートの基本解像度から試す
    2. ローカルR2VとAPIの2K・Video Regenerationは分けて考える
  13. 最初は短い動画で参照結果を確認する
  14. MiniMax H3 R2V向けプロンプトの書き方
    1. 参照素材の役割と完成シーンを分けて考える
    2. タグごとに「何を引き継ぐか」を1文ずつ明示する
  15. 参照素材を増やしすぎない方がよい理由
  16. R2Vがうまく反映されないときの改善方法
    1. 人物が似ない場合は参照画像とref_image_sizeを見直す
    2. 動きが反映されない場合はVideoの役割をmotionに絞る
    3. カメラが違う場合はmotionとcameraを分ける
    4. 声が安定しない場合はノイズの少ない単独話者音声を使う
    5. 別の参照が混ざる場合は素材数とタグ番号を減らして確認する
  17. R2Vを高速化するなら標準ワークフロー確認後に試す
  18. 他人の顔・動画・声を参照するときの注意点
  19. MiniMax H3 R2Vに関するよくある質問
    1. R2VではT2V・I2V用モデルを使えますか?
    2. 参照素材は最大数まで入れた方がよいですか?
    3. R2Vにはどの程度のVRAMが必要ですか?
    4. R2Vで完全ローカル2K動画を生成できますか?
    5. Sage Attentionは最初から入れた方がよいですか?
  20. まとめ|まずPicture 1だけでR2Vを試そう

MiniMax H3のR2Vとは?I2Vとの違い

R2VはReference-to-Videoの略で、画像・動画・音声などを参考情報として利用しながら新しい動画を生成する方法です。
入力画像そのものを動画の起点として扱うI2Vとは、参照素材の位置づけが異なります。

MiniMax H3は画像・動画・音声を含むマルチモーダルなコンテキストを理解し、自然言語で参照素材と完成映像の関係を指定できる設計になっています。

I2Vは画像を起点にし、R2Vは素材を参考情報として使う

I2Vでは、入力した画像を最初の画面として利用し、その画像から時間方向へ動きを作っていく考え方が基本です。
そのため、元画像の人物配置や背景、構図を活かしたまま動画化したい場合に向いています。

一方、R2Vでは画像を完成動画の開始フレームとして固定する必要はありません。
人物の顔や髪型だけをPicture 1から参照し、背景や構図、身体の動きは新しく生成するといった使い方ができます。

「この写真そのものを動かしたい」のであればI2Vを検討し、「この人物を使って別の場面を作りたい」のであればR2Vを検討すると整理しやすくなります。

入力画像を起点に動画化する手順を知りたい場合は、MiniMax H3 I2Vワークフローの使い方で確認してください。

R2Vでは人物・動き・カメラ・声を別々に参照できる

R2Vの特徴は、複数の素材へ異なる役割を持たせられることです。

画像から人物の顔や髪型、衣装、物体、作風を参照し、動画から身体の動作や演技、カメラワーク、テンポを参考にできます。
音声を追加すれば、声質や話し方を参照する構成も可能です。

MiniMax公式も、動画のカメラ運動、画像内の人物、別の音声を組み合わせ、それぞれの関係を自然言語で説明する例を紹介しています。

ただし、1つの素材へ人物・動き・カメラ・作風など多くの役割を持たせるほど、何を優先してほしいのか分かりにくくなります。
素材を追加する前に、「この素材から何を参照したいのか」を決めておくことが大切です。

R2Vで参照できる画像・動画・音声

MiniMax H3の公式ComfyUI実装では、画像・動画・音声を組み合わせてR2Vへ入力できます。
ただし、利用できる最大数は「使うべき数」ではなく、あくまで入力可能な上限です。

公式ノードでは、参照画像は最大9枚、参照動画は最大3本、参照動画に対応する音声は最大3本、単独の参照音声は最大3本まで設定できます。
参照動画の入力説明では24fps、2〜15秒が想定されています。

参照素材公式ノード上の上限主な用途
参照画像9枚人物、衣装、物体、作風
参照動画3本動き、演技、カメラ
動画に対応する音声3本参照動画の音声
単独音声3本声、話し方など

画像・動画・音声は用途ごとに役割を分けて使う

参照素材は、ファイル形式ではなく「何を担当させるか」で選ぶと分かりやすくなります。

素材主な役割
画像人物、衣装、物体、作風
動画身体の動き、演技、カメラ、テンポ
音声声、話し方
音声付き動画映像と音声を組み合わせた参照

たとえば、人物の外見を固定したいのに、似た人物写真を何枚も追加する必要はありません。
まず最も分かりやすい1枚をPicture 1として使い、人物の反映具合を確認した方が問題を切り分けやすくなります。

1素材につき1つの主な役割を決めることを基本にすると、プロンプトも整理しやすくなります。

初心者は画像1枚から始めて素材を段階的に増やす

最初のR2Vでは、人物画像1枚だけから始める方法がおすすめです。
人物が適切に反映されたら、次に動作動画を1本追加します。

人物と動きの組み合わせが確認できた後に音声を追加し、それでも必要な場合だけ2枚目の画像や2本目の動画を検討します。

素材を追加するたびに結果を比較すれば、「動画を追加してから人物が崩れた」「2枚目の画像を入れてから服装が混ざった」といった原因を判断できます。

最大数まで参照素材を入れても、品質が比例して上がるわけではありません。
少ない素材で目的を達成できるなら、その構成を維持した方が調整しやすくなります。

MiniMax H3 R2Vに必要なref2vaモデルを準備する

R2Vでは、T2V・I2Vとは異なるref2va系のDiffusion Modelを使用します。
MiniMax H3をすでにT2VやI2Vで使っている場合でも、Diffusion ModelだけはR2V用か確認してください。

公式R2Vテンプレートではminimax_h3_ref2va_pruned_int8_convrot.safetensorsが指定されています。

T2V・I2Vのfl2vaではなくR2V専用ref2vaを使う

MiniMax H3では、T2V・I2V側で使用するfl2vaと、R2V側で使用するref2vaを区別する必要があります。

公式R2Vテンプレートにも、R2Vではminimax_h3_ref2va_pruned_int8_convrot.safetensorsを使用し、T2V・I2V用のfl2vaとは異なる重みであることが明記されています。

名前が似ているため、以前ダウンロードしたMiniMax H3モデルをそのまま選んでしまいやすい部分です。
モデルの読み込みでエラーが出る場合や、R2Vテンプレートとモデル名が一致していない場合は、最初にDiffusion Modelを確認してください。

ダウンロード先や量子化形式の違いまで確認したい場合は、MiniMax H3のモデル導入方法を参照してください。

Diffusion Model・Text Encoder・VAEを指定フォルダへ保存する

2026年8月6日時点の公式R2Vテンプレートで使われている主要ファイルは次のとおりです。

種類ファイル名公開サイズ保存先
Diffusion Modelminimax_h3_ref2va_pruned_int8_convrot.safetensors約21GBComfyUI/models/diffusion_models/
Text Encoderqwen3vl_32b_minimax_h3_nvfp4_awq.safetensors約15.7GBComfyUI/models/text_encoders/
Video VAEminimax_h3_video_vae_fp16.safetensors約5.21GBComfyUI/models/vae/
Audio VAEminimax_h3_audio_vae_fp32.safetensors約605MBComfyUI/models/vae/

ファイル名、保存先、公開サイズはComfy-OrgのMiniMax H3リポジトリで確認できます。

配置後にモデルが一覧へ表示されない場合は、ComfyUIを再読み込みするか再起動します。
配布元が分からない再アップロードファイルを優先するのではなく、まず公式テンプレートやComfy-Orgが案内しているモデルを基準にすると確認しやすくなります。

ComfyUI公式のMiniMax H3 R2Vワークフローを開く

モデルを準備したら、最初からR2Vワークフローを自作する必要はありません。
ComfyUIにはMiniMax H3 R2Vの公式テンプレートが用意されています。

古いJSONやSNSで配布されている改造版を先に試すより、公式テンプレートが正常に動く状態を作ってから必要な変更を加える方がトラブルを切り分けやすくなります。

Template LibraryからMiniMax H3 R2Vを選ぶ

ComfyUIを更新したら、Workflowからテンプレートブラウザを開き、VideoカテゴリでMiniMax H3 R2Vを探します。
ComfyUI公式ドキュメントでは、組み込みテンプレートはWorkflowからBrowse Workflow Templatesを開いて利用でき、必要モデルのダウンロード案内も表示される仕組みになっています。

MiniMax H3 R2Vが表示されない場合は、ComfyUI本体だけでなく、workflow templates関連の依存関係が更新されているか確認してください。
新機能はStable版よりNightly版へ先に入る場合があり、DesktopやStableでは反映が遅れることがあります。

更新方法が分からない場合は、ComfyUIのアップデート方法を確認してください。

ワークフローは入力・参照・生成・保存の4ブロックで見る

R2Vテンプレートを開くと多数のノードが並びますが、すべてのノード名を暗記する必要はありません。

大きく見ると、Diffusion Model・Text Encoder・VAEを読み込む部分、参照画像やプロンプトを入力する部分、MiniMaxH3ReferenceToVideoでConditioningとLatentを作る部分、映像と音声をデコードしてMP4へ保存する部分に分けられます。

公式テンプレートにはResolution Selector、MiniMaxH3ReferenceToVideo、Video VAE、Audio VAE、CreateVideo、SaveVideoなどが配置されています。

ノードを左から右へ追いながら、「モデル」「参照」「生成」「保存」という流れで見ると構造を把握しやすくなります。

まずは参照画像1枚だけでR2Vを試す

R2Vを初めて試すなら、人物画像1枚だけをPicture 1へ接続した最小構成から始めます。

ここで確認したいのは動画の派手さではなく、「Picture 1で指定した人物の特徴が生成結果へ反映されるか」です。
人物参照が確認できてから動作動画を追加すると、問題の原因を追いやすくなります。

顔と外見が分かりやすい人物画像を1枚用意する

最初の人物画像には、顔が十分な大きさで写っている画像を選びます。
正面または斜め正面で、髪型や衣装も判別しやすい素材が扱いやすくなります。

強いモーションブラーがある画像、顔が手や髪で大きく隠れている画像、極端な魚眼レンズで歪んでいる画像は避けた方が原因を切り分けやすくなります。

背景の情報量が多すぎる写真より、人物が明確に認識できる素材から始めます。
生成したい髪型や服装が決まっている場合は、それらが確認できる画像を選んでください。

最初はPicture 1を人物の外見だけに使う

人物画像1枚を接続したら、Picture 1の主な役割をidentity、つまり人物の外見に絞ります。

プロンプトでは「<Picture 1>の人物の顔、髪型、外見を参照する」といった関係を明確にします。
一方、背景やカメラ位置、人物の新しい動作はテキスト側で指定します。

Picture 1に写っているポーズや背景まで厳密に引き継がせようとすると、R2Vで新しい場面を作る利点が薄くなります。

最初は人物の反映だけを確認し、問題がなければVideo 1を追加していきます。

Picture・Video・Audioタグと接続順の仕組み

R2Vで特に重要なのが、<Picture 1><Video 1><Audio 1>と実際の参照素材を一致させることです。

MiniMax H3の公式実装では、参照は画像、動画、音声として管理され、タグ番号は種類ごとに1から始まります。

Picture・Video・Audioは素材の種類ごとに番号が付く

<Picture 1>は1番目の参照画像を意味します。
2枚目の画像は<Picture 2>、3枚目なら<Picture 3>です。

同様に、1本目の動画は<Video 1>、1つ目の音声参照は<Audio 1>となります。
Picture 1とVideo 1はどちらも番号が1ですが、画像と動画なので別の参照素材です。

公式ノードの実装でも、タグは<Picture i><Video k><Audio j>として種類別に管理されています。

なお、参照動画へ対応するサウンドトラックを接続した場合、その音声にもAudioタグが割り当てられます。
その後に単独音声を追加すると、想定していたAudio番号がずれる可能性があるため、音声付き参照動画を使う場合は特に番号を確認してください。

接続順を変えたらプロンプト内の番号も確認する

複数素材を使っているときに接続順を変更した場合は、プロンプトのタグ番号も確認します。

たとえば、Picture 1を人物、Picture 2を衣装として使っていた状態で画像の順番を入れ替えると、以前と同じプロンプトでは役割が逆になる可能性があります。

素材が増えてきたら、ファイル名、タグ、役割を対応させた簡単な表を手元に作ると便利です。
ComfyUIのワークフロー内へメモを置き、「character_front.png=Picture 1=identity」のように記録しておく方法でも構いません。

参照結果がおかしくなった場合は、プロンプトを書き直す前にタグ番号と接続順を確認してください。

タグだけでなく「何を参照するか」まで文章で指定する

<Picture 1>と入力するだけでは、「その画像の何を使いたいのか」まで十分に伝わらない場合があります。

R2Vではタグを素材への参照先として使い、その素材の役割を文章で説明することが重要です。
公式テンプレートも、参照タグを正確に合わせ、どの参照素材が映像のどの要素を担当するか明示する方がよいと案内しています。

たとえば、「<Picture 1>から人物の外見を参照する」「<Video 1>から身体の動きを参照する」「<Audio 1>から声を参照する」と分けます。

タグと役割をセットで考えることが、R2Vを組み立てる基本になります。

参照素材ごとに人物・動き・声の役割を割り当てる

複数参照を使う場合は、「素材→タグ→役割」の順に整理してからプロンプトを書くと混乱しにくくなります。

たとえばPicture 1を人物、Picture 2を衣装、Video 1を身体の動き、Video 2をカメラ、Audio 1を声に割り当てます。

1つの参照素材には1つの主な役割を持たせる

1本の動画には人物の顔、衣装、身体の動き、背景、カメラワークなど多くの情報が含まれています。
R2Vが複数要素を理解できるからといって、すべてを同時に強く参照させる必要はありません。

Video 1を動作参照に使うなら、「Video 1はmotionを担当する」という主目的を決めます。
人物の外見はPicture 1へ任せ、完成シーンの背景はプロンプト側で指定する方が役割を整理できます。

結果が崩れた場合も、Video 1を外せばmotion参照の影響を確認できます。
参照素材を大量に追加するより、少数の素材へ明確な役割を持たせる方が検証しやすくなります。

素材・タグ・役割を表で管理すると混乱しにくい

複数参照を使う場合は、次のように整理しておくと便利です。

素材タグ主な役割
人物画像Picture 1identity
衣装画像Picture 2outfit
動作動画Video 1motion
カメラ動画Video 2camera
音声Audio 1voice

素材ファイル名にもcharacter_identitywalk_motiontracking_cameraのように役割が分かる名前を付けておくと、後からワークフローを開いたときにも確認しやすくなります。

ComfyUIのメモとプロンプト内のタグを同じ内容にしておけば、Picture 1とPicture 2を取り違えるミスも減らせます。

人物画像+動作動画でR2Vする方法

R2Vの特徴を理解しやすいのが、人物画像1枚と動作動画1本を組み合わせる構成です。

Picture 1から人物の外見を取り、Video 1から身体の動きを参照させます。
「誰が」「どの動きをするのか」を分離して指定できるため、R2Vの役割分担を確認しやすい構成です。

Picture 1は人物、Video 1は身体の動きに使う

Picture 1には、顔や髪型、衣装が分かりやすい人物画像を接続します。
Video 1には、参考にしたい身体の動作が見やすい動画を接続します。

たとえば歩き方を参照したいなら、カメラが激しく揺れる動画より、人物の全身と歩行動作が確認しやすい動画の方が目的を明確にできます。

役割はPicture 1=identity、Video 1=motionとします。
Video 1に写っている別の人物の外見を引き継がせるのではなく、動作を参照したいことをプロンプトで説明します。

公式MiniMax H3も、画像の人物と動画の動作を別々のコンテキストとして扱える設計です。

「Picture 1の人物がVideo 1の動きをする」と関係を明示する

2素材構成では、タグを並べるだけでなく両者の関係を書きます。

プロンプト例は、「<Picture 1>の人物の顔、髪型、衣装を参照する。
その人物が<Video 1>の身体の動きと歩行テンポを行う。
夜の繁華街を歩き、カメラは人物の横からゆっくり追従する。
背景の通行人とネオンは新しいシーンとして生成する。」という形です。

ここではPicture 1が「誰」、Video 1が「どう動くか」、残りの文章が「どこで何を撮るか」を担当しています。

Video 1では右へ歩いているのに、テキストで「その場で立ち止まる」など競合する動作を追加すると意図が曖昧になります。
最初は参照動画とプロンプトの動作を揃えてください。

人物+動き、カメラ参照など用途別の完成例を増やしたい場合は、MiniMax H3 R2Vプロンプト実例集で確認できます。

人物画像+動作動画+音声でR2Vする方法

人物と動きの参照が確認できたら、次にAudio 1を追加します。

基本的な役割はPicture 1=人物、Video 1=演技・身体動作、Audio 1=声です。
3素材になっても、一度に複雑な役割を増やさないことがポイントです。

Audio 1は声の参照として使う

Audio 1へ読み込んだ音声は、単純に完成動画の音声トラックへ貼り付けるものとして考えるのではなく、R2Vの参照情報として扱います。

声質や話し方を参照させたい場合は、1人の声が明確に聞こえる素材を使います。
BGMが大きい音声、複数人が同時に話している音声、強い環境ノイズが含まれる素材は、何を参照したいのか曖昧になりやすいため、最初の検証では避けた方が分かりやすくなります。

完全に同じ声が再現されると考えるのではなく、参照した声の特徴がどの程度反映されるかを確認してください。

Picture・Video・Audioの役割を1文ずつ明示する

3素材構成では、すべてを1文へ詰め込まず、それぞれの役割を分けます。

たとえば、「<Picture 1>の人物の顔、髪型、衣装を参照する。
<Video 1>の身体の演技と動作テンポを参照する。
<Audio 1>の声質と話し方を参照する。
人物は夜の屋上に立ち、カメラへ向かってセリフを話す。
カメラはゆっくり前進し、背景には街の環境音を入れる。」という形です。

前半が参照条件、後半が完成動画の条件になっています。

参照素材と完成映像を分けて書けば、どこを修正すればよいか判断しやすくなります。

参照動画からカメラワークを取り入れる方法

参照動画は身体の動きだけでなく、カメラワークを参考にする用途にも利用できます。

たとえばpan、zoom、dolly、handheld、tracking shotなど、参考動画の撮影表現をVideoへ担当させます。

身体の動きとカメラの両方を1本の複雑な動画から参照すると分かりにくい場合は、Video 1=motion、Video 2=cameraのように分離します。

プロンプトでは、「<Video 1>の人物の身体動作を参照する。
<Video 2>の横方向のtracking shotとカメラ速度を参照する。」のように役割を書きます。

カメラ参照用の動画は、激しい編集や多数のカットが入った映像より、意図したカメラ移動が確認しやすい素材から試す方が比較しやすくなります。

ref_image_sizeのmatchとmaxの違い

MiniMaxH3ReferenceToVideoにはref_image_sizeという設定があり、matchmaxを選択できます。

matchは参照画像を生成側の画素面積に合わせて縮小し、maxは参照画像の短辺を最大2048pxまで保持する方式です。
どちらも元画像より大きくアップスケールする設定ではありません。

最初はmatchで速度と結果を確認する

初回はmatchから始めると調整しやすくなります。

公式ノードでもmatchが初期値です。
参照トークンはサンプリングの各ステップで利用されるため、maxは処理が大幅に重くなる場合があると説明されています。

まずmatchでPicture 1の人物、Video 1の動き、タグ番号が正しいかを確認します。

人物画像そのものが小さい、ブレている、顔が隠れているといった問題があるなら、設定を変える前に素材を交換する方が原因を切り分けやすくなります。

人物が似ない場合にmaxを比較する

Picture 1の顔や細部が十分に反映されず、参照画像の解像度にも余裕がある場合はmaxを比較します。

このときはSeedやプロンプト、動画時間などを変えず、ref_image_sizeだけをmatchからmaxへ変更すると違いを判断しやすくなります。

maxでは短辺2048pxまで参照画像を保持できるため、identity fidelityを高める目的で用意されていますが、必ず結果が良くなるわけではありません。

VRAM使用量や生成時間も増える可能性があるため、人物の変化と処理負荷を両方比較してください。

R2Vの解像度設定と2Kの注意点

解像度はResolution SelectorでAspect ratio、Megapixels、Multipleを設定します。

公式R2Vテンプレートでは16:9の場合、0.98MPで1344×768、2.0MPで1920×1088になる設定例が掲載されています。

ただし、「MiniMax H3が2Kに対応すること」と「ComfyUIのR2Vで使われる処理がMiniMax公式サービスの2K生成パイプラインと完全に同じこと」は分けて考える必要があります。

最初は公式テンプレートの基本解像度から試す

初回は高解像度を狙うより、人物や動きの参照が正しいかを確認できる条件から始めます。

公式テンプレートのMiniMaxH3ReferenceToVideoには1344×768、約5秒、ref_image_size=matchが初期値として入っています。

16:9なら1344×768前後の768p系を基準にし、まず参照素材とタグの組み合わせを確認すると効率的です。

縦動画を作る場合はAspect ratioを目的に合わせて変更します。
Multipleはテンプレートの案内に従い、最初から複数の設定を同時に変えないようにしてください。

ローカルR2VとAPIの2K・Video Regenerationは分けて考える

MiniMax H3自体は最大15秒、2Kをサポートすると公式に案内されています。

一方、MiniMaxは2K出力について、単純な専用超解像ではなく、低解像度の結果をH3自身でIn-context Regenerationする方式を採用していると説明しています。

そのため、公式ComfyUIテンプレートのResolution Selectorで高いMegapixelsを選ぶことと、MiniMax側で提供される2KのRegeneration処理を同じものとして扱わない方が安全です。

「MiniMax H3は2K対応だから、ComfyUIのローカルR2Vでも公式サービスと同じ2Kパイプラインが常に動く」とは断定できません。

ローカル版とサービス/API側の提供範囲を整理したい場合は、MiniMax H3のローカル版・API版・2K対応の違いを確認してください。

最初は短い動画で参照結果を確認する

R2Vの最初の検証では、長尺より短い動画を使う方が調整しやすくなります。

公式テンプレートの初期値は約5秒です。
MiniMax H3のノードでは24fpsを基準にフレーム数が調整され、公式実装には約5秒の124フレームが初期値として設定されています。

最初の生成では人物の顔と衣装、Video 1の動き、背景、カメラ、音声を確認します。

問題がなければ、成功した素材構成、Seed、プロンプトを基準に動画時間を延ばします。

長くするほど人物の一貫性、動作の継続、音声、背景変化など確認する項目も増えるため、最初から長尺へ進むより短い生成で基礎を固めた方が修正しやすくなります。

MiniMax H3 R2V向けプロンプトの書き方

R2V向けプロンプトでは、「参照素材から何を引き継ぐか」と「最終的にどんな動画を生成するか」を分けて考えます。

タグを並べるだけでも、完成映像の説明だけでも不十分になりやすいため、2つの階層を組み合わせて書きます。

MiniMax H3では自然言語が参照素材同士の関係を結び付ける重要な役割を持つと説明されています。

参照素材の役割と完成シーンを分けて考える

最初に参照側を整理します。

Picture 1はidentity、Video 1はmotion、Audio 1はvoiceという関係を決めます。

その後に完成動画の場面を書きます。
たとえば夜の都市を歩く、カメラは横から追従する、人物がセリフを話す、遠くで車の環境音が聞こえる、といった内容です。

プロンプト例は、「<Picture 1>の人物の外見を参照する。
<Video 1>の身体の歩行動作とテンポを参照する。
<Audio 1>の声質と話し方を参照する。
人物は雨上がりの夜の繁華街を歩きながらカメラへ話しかける。
カメラは人物の横を一定距離で追従する。
濡れた道路へネオンが反射し、遠くに交通音が聞こえる。」という構成です。

参照側へ背景、演出、効果音まで詰め込まず、完成シーンと分けることで役割が明確になります。

タグごとに「何を引き継ぐか」を1文ずつ明示する

複数参照では、1文ですべて説明するより、タグごとに役割を書く方が修正しやすくなります。

分解すると、「<Picture 1>の人物の顔、髪型、衣装を参照する。
<Video 1>の身体の動作を参照する。
<Audio 1>の声質と話し方を参照する。」となります。

カメラ用の動画を追加した場合は、「<Video 2>のdolly movementとカメラ速度を参照する。」と追加します。

その後に人物の動作、カメラ、セリフ、効果音、BGM、照明、映像表現など完成動画の条件を書きます。

公式R2Vテンプレートでも、タグを正確に指定し、参照素材が映像のどの部分を担当するのか具体的に書くことが重要とされています。

用途別に完成済みのプロンプトを確認したい場合は、MiniMax H3 R2Vプロンプト実例集を参照してください。

参照素材を増やしすぎない方がよい理由

R2Vでは参照素材が多いほど品質が高くなるとは限りません。

たとえば人物画像を何枚も追加すると、髪型や衣装、年齢感、撮影条件など異なる特徴が混ざる可能性があります。
動作動画を複数追加すれば、どの動きを優先すべきか曖昧になることもあります。

さらに、素材が増えるほどプロンプト内のPicture・Video・Audio番号が増え、番号ミスや役割競合を見つけにくくなります。

最初はPicture 1だけで成功させ、次にVideo 1、必要であればAudio 1を追加します。

新しい素材を追加するときは、可能な範囲でSeedや他の設定を揃えて比較してください。
結果が悪化した場合に、直前に追加した素材の影響を判断しやすくなります。

R2Vがうまく反映されないときの改善方法

参照結果がおかしい場合は、プロンプトを全面的に書き換える前に、人物、動き、カメラ、音声を分けて確認します。

同じSeedと基本設定を使い、変更する項目を1つずつにすると原因を見つけやすくなります。

人物が似ない場合は参照画像とref_image_sizeを見直す

Picture 1の人物が似ない場合は、顔が大きく、ブレや遮蔽が少ない画像へ変更します。

プロンプトでもPicture 1=identityであることを明示してください。

複数の人物画像を入れている場合はいったんPicture 1だけへ戻します。

タグと素材に問題がないことを確認したうえで、ref_image_sizematchからmaxへ変更し、同じSeedで比較します。

複数動画でも同じ人物の外見を揃えたい場合は、MiniMax H3でキャラクター一貫性を高める方法も確認してください。

動きが反映されない場合はVideoの役割をmotionに絞る

Video 1の動きが弱い場合は、最初に動作そのものが分かりやすい参照動画か確認します。

激しいカメラ移動、細かい編集、複数人物の異なる動作が含まれる動画は、motionだけを確認したい検証には向きません。

プロンプトではVideo 1=motionと明示し、参照動画とは異なる動作を同時に書かないようにします。

それでも反映が弱い場合は、より単純な動作の動画へ変更し、Video参照が機能しているか確認してください。

カメラが違う場合はmotionとcameraを分ける

1本の動画から身体の演技と複雑なカメラ移動を同時に参照している場合は、役割を分けます。

Video 1をmotion、Video 2をcameraとして、カメラ側にはtracking shot、pan、dollyなど目的が分かりやすい動画を使用します。

プロンプトにも「Video 2のcamera movementを参照する」と書き、必要に応じて「slow dolly in」「side tracking shot」などテキストで補足します。

声が安定しない場合はノイズの少ない単独話者音声を使う

Audio 1の声が安定しない場合は、1人だけが明瞭に話している音声を選びます。

大きなBGM、環境音、他の話者が重なっている素材は避けます。

プロンプトではAudio 1=voiceであることを明示し、複数の音声参照を使っている場合はいったん1つまで減らします。

音声参照は完全な声の複製を保証する機能として考えず、入力素材と生成結果を比較しながら調整してください。

別の参照が混ざる場合は素材数とタグ番号を減らして確認する

別の人物や衣装、動画の特徴が混ざる場合は、Picture・Video・Audioの番号を再確認します。

接続順を変更した直後に問題が発生した場合は、プロンプトのタグ番号も更新されているか確認してください。

それでも原因が分からなければ、いったんPicture 1だけへ戻します。
次にPicture 1+Video 1まで追加し、正常に生成できる場所を探します。

複数の素材で同じ役割を競わせるより、1素材1役割へ戻してから必要な参照だけを追加する方が調整しやすくなります。

R2Vを高速化するなら標準ワークフロー確認後に試す

Sage Attentionなどの高速化を試す場合も、最初に公式の標準ワークフローで正常生成できる状態を作ります。

高速化設定や追加ライブラリを最初から複数導入すると、エラーがR2V本体によるものなのか高速化環境によるものなのか判断しにくくなります。

まず標準状態で使用したSeed、解像度、動画時間、参照素材、生成時間、VRAM使用状況を記録します。

その後に高速化設定を追加し、同じ条件で比較します。

速度の改善幅はGPU、PyTorch、CUDA、量子化形式、解像度などによって変わるため、一定倍率で高速化すると考えない方が安全です。

標準ワークフローが正常に動いた後で導入する場合は、ComfyUIでSage Attentionを導入する方法を参照してください。

他人の顔・動画・声を参照するときの注意点

R2Vへ素材を技術的に読み込めることと、その生成結果を自由に公開・商用利用できることは別の問題です。

基本的には、自分で制作・撮影・録音した素材や、必要な許諾を確認できる素材を使う方が安全です。

他人の顔写真、芸能人やインフルエンサーの画像、他人が制作した動画、映画やMV、広告映像、既存キャラクター、他人の声などには、著作権、肖像に関する権利、契約、利用規約など複数の論点が関係する可能性があります。

特に声や顔を本人らしく見せる用途では、技術的に生成できるかだけで公開判断をしないようにしてください。

商用利用する場合は、使用する参照素材とモデル双方のライセンスや利用条件を確認します。
MiniMax H3のComfy-Org版にもMiniMax H3 Community License Agreementが設定されています。

個別ケースの法的判断が必要な場合は専門家へ確認し、一般的な整理についてはAI動画の著作権・肖像権・商用利用を参照してください。

MiniMax H3 R2Vに関するよくある質問

最後に、MiniMax H3 R2Vで迷いやすいポイントを簡単に整理します。
仕様に関する内容は2026年8月6日時点で確認しています。

R2VではT2V・I2V用モデルを使えますか?

R2Vではref2va系のDiffusion Modelを使用します。
公式R2Vテンプレートはminimax_h3_ref2va_pruned_int8_convrot.safetensorsを指定しており、T2V・I2V側のfl2vaとは区別されています。

詳しい配置方法はMiniMax H3のモデル導入方法で確認してください。

参照素材は最大数まで入れた方がよいですか?

最大数は入力できる上限であり、高品質になることを保証する数ではありません。

最初はPicture 1から始め、必要に応じてVideo 1、Audio 1を追加してください。

結果が混ざった場合は素材を減らし、役割を整理します。

R2Vにはどの程度のVRAMが必要ですか?

必要VRAMは一律には決められません。

Diffusion ModelやText Encoderの量子化形式、解像度、動画時間、参照素材数、ref_image_size、オフロード状況などで変化します。

特にref_image_size=maxは参照トークン量が増え、処理が重くなる可能性があります。

自分の環境での目安を確認したい場合は、MiniMax H3の必要VRAM・生成時間を参照してください。

R2Vで完全ローカル2K動画を生成できますか?

MiniMax H3自体は2Kに対応していますが、MiniMax公式は2K出力でIn-context Regenerationを利用すると説明しています。

そのため、ComfyUIのローカルR2Vテンプレートと公式サービス/API側の2K生成を同一の処理として断定しない方が安全です。

最新の提供範囲はMiniMax H3のローカル版・API版・2K対応の違いで整理しています。

Sage Attentionは最初から入れた方がよいですか?

最初は標準ワークフローをおすすめします。

正常生成を確認してからSage Attentionなどの高速化を追加すれば、問題が起きたときに原因を判断しやすくなります。

導入後は同じSeedと設定で速度、VRAM、生成結果を比較してください。

まとめ|まずPicture 1だけでR2Vを試そう

MiniMax H3 R2Vでは、参照素材を追加することより、「どの素材から何を参照するか」を決めることが重要です。

最初はPicture 1=人物の外見だけで生成し、正常に反映されたらVideo 1=身体の動きを追加します。
その後、必要であればAudio 1=声を追加してください。

Picture・Video・Audioのタグ番号は実際の接続と一致させ、ref_image_sizeはまずmatchから確認します。

人物が似ない、動きが反映されない、声が安定しない場合も、素材、タグ番号、役割を一度に変更せず、1項目ずつ見直すと原因を判断しやすくなります。

参照素材は数を増やすほど良いわけではありません。
権利を確認できる素材を使い、少ない構成から段階的にR2Vを組み立ててください。

人物+動き、人物+音声、カメラ参照まで試したい場合は、MiniMax H3 R2Vプロンプト実例集を見ながら、まずPicture 1から自分の素材へ置き換えて試してみてください。

コメント