Référence vers Vidéo IA : Chaque Modèle, Ses Limites et Son Prix
L'IA référence-vers-vidéo garde vos personnages, produits et voix dans un nouveau plan. Tous les modèles disponibles sur Reelina, le nombre de références acceptées et leur prix.

L'image-vers-vidéo part d'une seule image. La référence-vers-vidéo est différente : vous donnez au modèle plusieurs éléments à conserver — un personnage, un produit, une tenue, un lieu, parfois une voix — et il construit un nouveau plan autour d'eux. C'est ce qui se rapproche le plus d'un casting dans l'IA vidéo.
Reelina propose 26 modèles de référence-vers-vidéo. Ils se distinguent moins par ce qu'ils promettent que par ce qu'ils acceptent : combien d'images, si une vidéo de référence est autorisée, si le son est inclus, et quelle peut être la durée du résultat. Ce guide les répertorie à partir du catalogue Reelina en date d'octobre 2026, avec le prix d'une génération en pièces pour la durée par défaut de chaque modèle.
Comment fonctionne la référence-vers-vidéo
Vous téléchargez des références — généralement une image par sujet — et écrivez un prompt qui décrit ce qu'elles font. Le modèle n'est pas entraîné sur vos références : il les lit pour cette seule génération. Cela a deux conséquences :
- La cohérence vient de la réutilisation des mêmes références. Conservez un portrait net de chaque personnage et donnez-le à chaque plan.
- Un seul sujet par image fonctionne mieux. Un fond neutre et un éclairage homogène évitent que le modèle ne copie l'éclairage dans la scène.
Les modèles, selon ce qu'ils acceptent
| Modèle | Pièces | Références | Durée |
|---|---|---|---|
| PixVerse v6 Reference-to-Video | 38 | Références | 1–15 s |
| PixVerse c1 Reference-to-Video | 46 | Références | 1–15 s |
| Wan 3.0 Reference-to-Video | 60 | Références | 2–30 s |
| Vidu Q3 Reference-to-Video | 64 | Références, audio optionnel | — |
| Seedance 2.0 Mini Reference-to-Video | 68 | Jusqu'à 9 images, 3 vidéos (15 s au total), audio de référence | 4–15 s |
| Grok Imagine Video Reference-to-Video | 76 | 1–7 images (personnes, objets, styles) | — |
| Wan 3.0 Prime Reference-to-Video | 92 | Références | 2–30 s |
| Vidu Q2 Reference-to-Video | 96 | 1–7 sujets, audio optionnel | — |
| Kling Video O3 Std Reference-to-Video | 108 | « Éléments » sujets | 3–15 s |
| Seedance 2.0 Fast Reference-to-Video | 110 | Jusqu'à 9 images, 3 vidéos, audio de référence | 4–15 s |
| MiniMax H3 Fast Reference-to-Video | 112 | Références | 5–15 s (8 s par défaut) |
| Grok Imagine Video v1.5 Reference-to-Video | 122 | 1–7 images | — |
| Vidu Q2-Pro Reference-to-Video | 128 | 1–7 sujets, audio optionnel | — |
| Seedance 2.0 Reference-to-Video | 136 | Jusqu'à 9 images, 3 vidéos, audio de référence | 4–15 s |
| Kling Video O3 Pro Reference-to-Video | 144 | « Éléments » sujets | 3–15 s |
| Wan 2.7 Reference-to-Video | 152 | Jusqu'à 3 vidéos — une par personnage, qui peut porter sa voix | — |
| MiniMax H3 Reference-to-Video | 152 | Références | 4–15 s (8 s par défaut) |
| Seedance 2.5 Reference-to-Video | 204 | Jusqu'à 30 images, 10 vidéos, audio de référence | 4–30 s |
| Veo 3.1 Reference-to-Video | 484 | Références, audio optionnel | 8 s |
Également au catalogue : Vidu Q3-Mix (160), Gemini Omni Flash (204), HappyHorse 1.1 (106) et 1.0 (212), Vidu Reference-to-Video 2.0 (304), Vidu Q1 (516) et Vidu Reference-to-Video Q1 (606). « — » signifie que la durée est fixée par le modèle plutôt que choisie. Les prix correspondent à la durée par défaut de chaque modèle ; les clips plus longs coûtent proportionnellement plus, et le coût exact s'affiche avant de générer.
Lequel choisir
- Le moyen le moins cher de tester l'idée : PixVerse v6 (38 pièces) ou Wan 3.0 (60 pièces, jusqu'à 30 secondes).
- Un casting de personnages plus une référence en mouvement : Seedance 2.0 — jusqu'à 9 images et 3 vidéos de référence, avec audio de référence. Ébauchez sur Mini (68), finalisez sur le modèle complet (136).
- Des plans longs et riches en références : Seedance 2.5 — jusqu'à 30 images et 10 vidéos, des clips jusqu'à 30 secondes.
- Des personnages qui doivent garder leur propre voix : Wan 2.7, où chaque vidéo de référence correspond à un personnage et peut porter sa voix.
- Jusqu'à sept sujets distincts : Vidu Q2 / Q2-Pro ou Grok Imagine Video.
- La vision de Kling : Kling Video O3, avec des « éléments » sujets.
Des images de référence pour les images aussi
Si vous avez besoin d'une image fixe, Nano Banana 2 Reference-to-Image (24 pièces) et sa version Lite (13 pièces) construisent une image à partir de références, et les deux acceptent un clip vidéo comme référence.
Comment faire sur Reelina
- Ouvrez le Video studio et choisissez un modèle de référence-vers-vidéo — par exemple Seedance 2.0 Reference-to-Video ou Seedance 2.5 Reference-to-Video.
- Téléchargez vos références et décrivez le plan : qui fait quoi, où, et comment la caméra se déplace.
- Vérifiez le prix affiché sur le bouton et générez. Conservez les références — les réutiliser est ce qui garantit la cohérence du plan suivant.
Pour un épisode entier plutôt qu'un seul plan, le générateur de drama IA fait cela pour vous : il attribue à chaque personnage un portrait de référence et poursuit chaque plan à partir de la dernière image du précédent.
FAQ
Qu'est-ce que l'IA référence-vers-vidéo ? Un modèle vidéo qui prend plusieurs entrées de référence — images, et pour certains modèles vidéos et audio — et génère un nouveau plan qui conserve ces sujets, au lieu d'animer une seule image de départ.
Combien d'images de référence puis-je utiliser ? Cela dépend du modèle : jusqu'à 30 sur Seedance 2.5, 9 sur Seedance 2.0, 1 à 7 sur Vidu Q2 et Grok Imagine Video. Wan 2.7 accepte à la place jusqu'à 3 vidéos de référence.
Quel est le modèle de référence-vers-vidéo le moins cher ? Sur Reelina, PixVerse v6 Reference-to-Video à 38 pièces par génération.
Le modèle apprend-il mon visage ? Non. Les références sont lues pour cette seule génération ; rien n'est entraîné. La cohérence vient du fait de donner les mêmes références à chaque plan.
Ai-je besoin d'une clé API ? Non. Chaque modèle fonctionne dans le navigateur sur un solde de pièces Reelina unique. Il n'y a pas d'offre gratuite.
Try it yourself
Every model on one credit balance, straight in your browser. No install, no watermark.
Start creatingKeep reading
Seedance 2.0 contre Kling 3.0 : spécifications, prix et quand utiliser chacunSeedance 2.0 contre Kling 3.0 : formules, durée des clips, formats d'image, audio, référence-vers-vidéo contre plans multiples et contrôle du mouvement, et coût à la seconde en pièces.
Kling 3.0 vs Veo 3.1 : durée des clips, audio et coût comparésKling 3.0 vs Veo 3.1 : clips de 3 à 15 s contre 4, 6 ou 8 s, formats d'image, résolutions, quels niveaux génèrent du son, et coût par seconde pour chaque variante.
Seedance vs Seedream : de quel modèle ByteDance avez-vous besoin ?Seedance génère des vidéos, Seedream des images — tous deux viennent de ByteDance. Variantes, tailles, audio et prix en pièces comparés, et comment les utiliser ensemble.
