Reference to Video AI:全モデルの制限と料金まとめ
Reference-to-video AIは、キャラクターや製品、声を新しいショットの中で保ち続けます。Reelinaで使える全モデルと、それぞれが受け付ける参照数、料金を解説します。

Image-to-video(画像から動画)は1枚の画像から始まります。Reference-to-videoはこれとは違い、キャラクターや製品、服装、場所、時には声といった「保ち続けたいもの」を複数モデルに渡すと、それらを中心に新しいショットを組み立ててくれます。AI動画の中では、いわば「キャスティング」に最も近い機能です。
Reelinaには26種類のreference-to-videoモデルが揃っています。モデル間の違いは「何を約束するか」よりも「何を受け付けるか」にあります。画像を何枚使えるか、参照用の動画を渡せるか、音声も一緒に渡せるか、結果の長さはどこまで選べるか——こうした点が異なります。本ガイドでは、2026年10月時点のReelinaカタログに掲載されているモデルを一覧にし、各モデルの標準的な長さで1回生成するのに必要なコイン数も記載しています。
Reference-to-videoの仕組み
参照素材(多くの場合、被写体1つにつき画像1枚)をアップロードし、それらが何をするかをプロンプトで指定します。モデルは参照素材で学習されるわけではなく、その1回の生成のためだけに読み込まれます。これには2つの結果があります。
- 一貫性は、同じ参照素材を繰り返し使うことで生まれます。 各キャラクターの背景がすっきりしたポートレートを用意し、すべてのショットで使い回しましょう。
- 1枚の画像に被写体を1つだけ入れるのが最も効果的です。 背景をシンプルに、光を均一にすることで、モデルがその照明をそのままシーンにコピーしてしまうのを防げます。
受け付ける内容別に見る全モデル
| モデル | コイン | 参照素材 | 長さ |
|---|---|---|---|
| PixVerse v6 Reference-to-Video | 38 | 参照素材 | 1〜15秒 |
| PixVerse c1 Reference-to-Video | 46 | 参照素材 | 1〜15秒 |
| Wan 3.0 Reference-to-Video | 60 | 参照素材 | 2〜30秒 |
| Vidu Q3 Reference-to-Video | 64 | 参照素材、音声(任意) | — |
| Seedance 2.0 Mini Reference-to-Video | 68 | 画像最大9枚、動画3本(合計15秒)、参照音声 | 4〜15秒 |
| Grok Imagine Video Reference-to-Video | 76 | 画像1〜7枚(人物、物体、スタイル) | — |
| Wan 3.0 Prime Reference-to-Video | 92 | 参照素材 | 2〜30秒 |
| Vidu Q2 Reference-to-Video | 96 | 被写体1〜7個、音声(任意) | — |
| Kling Video O3 Std Reference-to-Video | 108 | 被写体「エレメント」 | 3〜15秒 |
| Seedance 2.0 Fast Reference-to-Video | 110 | 画像最大9枚、動画3本、参照音声 | 4〜15秒 |
| MiniMax H3 Fast Reference-to-Video | 112 | 参照素材 | 5〜15秒(デフォルト8秒) |
| Grok Imagine Video v1.5 Reference-to-Video | 122 | 画像1〜7枚 | — |
| Vidu Q2-Pro Reference-to-Video | 128 | 被写体1〜7個、音声(任意) | — |
| Seedance 2.0 Reference-to-Video | 136 | 画像最大9枚、動画3本、参照音声 | 4〜15秒 |
| Kling Video O3 Pro Reference-to-Video | 144 | 被写体「エレメント」 | 3〜15秒 |
| Wan 2.7 Reference-to-Video | 152 | 動画最大3本——キャラクター1人につき1本、声も保持可能 | — |
| MiniMax H3 Reference-to-Video | 152 | 参照素材 | 4〜15秒(デフォルト8秒) |
| Seedance 2.5 Reference-to-Video | 204 | 画像最大30枚、動画10本、参照音声 | 4〜30秒 |
| Veo 3.1 Reference-to-Video | 484 | 参照素材、音声(任意) | 8秒 |
カタログにはほかにも、Vidu Q3-Mix(160)、Gemini Omni Flash(204)、HappyHorse 1.1(106)と1.0(212)、Vidu Reference-to-Video 2.0(304)、Vidu Q1(516)、Vidu Reference-to-Video Q1(606)が掲載されています。「—」は、長さを選択できずモデル側で固定されていることを示します。表示している料金は各モデルの標準的な長さの場合のものです。長いクリップほど料金は比例して高くなり、正確な料金は生成前に画面上で確認できます。
どれを選ぶべきか
- とにかく安く試したい場合: PixVerse v6(38コイン)、またはWan 3.0(60コイン、最大30秒)。
- 複数キャラクターに加えて動く参照素材も使いたい場合: Seedance 2.0——画像最大9枚と参照動画3本、参照音声にも対応。下書きはMini(68コイン)、仕上げはフル版(136コイン)で。
- 参照素材を多く使う長めのショット: Seedance 2.5——画像最大30枚、動画10本、クリップは最大30秒まで。
- キャラクターの声をそのまま保ちたい場合: Wan 2.7。参照動画1本がキャラクター1人に対応し、その声も保持できます。
- 被写体を最大7個まで別々に使いたい場合: Vidu Q2/Q2-Pro、またはGrok Imagine Video。
- Klingならではのアプローチ: 被写体を「エレメント」として扱うKling Video O3。
画像生成にも参照画像を
静止画が必要な場合は、Nano Banana 2 Reference-to-Image(24コイン)とそのLite版(13コイン)が参照素材から画像を生成してくれます。いずれも動画クリップを参照として渡すことができます。
Reelinaでの使い方
- Video studioを開き、reference-to-videoモデルを選びます——たとえばSeedance 2.0 Reference-to-VideoやSeedance 2.5 Reference-to-Video。
- 参照素材をアップロードし、ショットの内容——誰が何をするか、どこで、カメラがどう動くか——を記述します。
- ボタンに表示された料金を確認して生成します。参照素材は保存しておきましょう——次のショットでも一貫性を保つために再利用できます。
単発のショットではなく一本のエピソード全体を作りたい場合は、AI drama generatorが代わりにやってくれます。各キャラクターを参照用ポートレートとしてキャスティングし、前のショットの最後のフレームから次のショットを続けて生成します。
FAQ
Reference-to-video AIとは? 複数の参照入力——画像、そしてモデルによっては動画や音声——を受け取り、1枚の開始画像をアニメーション化するのではなく、それらの被写体を保った新しいショットを生成する動画モデルのことです。
参照画像は何枚まで使えますか? モデルによって異なります。Seedance 2.5では最大30枚、Seedance 2.0では9枚、Vidu Q2とGrok Imagine Videoでは1〜7枚です。Wan 2.7は画像の代わりに参照動画を最大3本まで受け付けます。
最も安いreference-to-videoモデルはどれですか? Reelinaでは、PixVerse v6 Reference-to-Videoが1回の生成あたり38コインで最も安価です。
モデルは私の顔を学習しますか? いいえ。参照素材はその1回の生成のためだけに読み込まれ、何かが学習されるわけではありません。一貫性は、すべてのショットに同じ参照素材を渡すことで保たれます。
APIキーは必要ですか? いいえ。すべてのモデルはブラウザ上で動作し、Reelinaのコイン残高1つで利用できます。無料プランはありません。
Try it yourself
Every model on one credit balance, straight in your browser. No install, no watermark.
Start creatingKeep reading
Seedance 2.0 vs Kling 3.0:スペック・価格・使い分けガイドSeedance 2.0とKling 3.0のティア、クリップ長、アスペクト比、音声対応、Reference-to-Videoとマルチショット・モーションコントロールの違い、そして1秒あたりのコインコストを比較する。
Seedance vs Seedream:ByteDanceのどちらのモデルが必要かSeedanceは動画を、Seedreamは画像を生成する——どちらもByteDance製。バリエーション、サイズ、音声、コイン価格を比較し、組み合わせ方も解説する。
Kling 3.0 vs Veo 3.1: クリップ長・音声・コストを比較Kling 3.0とVeo 3.1を比較:3〜15秒のクリップと4・6・8秒の固定長、アスペクト比、解像度、音声生成の有無、各バリエーションの秒あたりコストまで解説。
