Reference to Video AI: ogni modello, i suoi limiti e il suo prezzo
L'AI reference-to-video mantiene i tuoi personaggi, prodotti e voci in una nuova scena. Ecco tutti i modelli su Reelina, quante immagini di riferimento richiede ciascuno e il relativo prezzo.

L'image-to-video parte da una singola immagine. Il reference-to-video è diverso: dai al modello diversi elementi da mantenere — un personaggio, un prodotto, un outfit, un luogo, a volte anche una voce — e lui costruisce una nuova scena intorno a loro. È la cosa più simile a un casting che l'AI video abbia mai avuto.
Reelina offre 26 modelli reference-to-video. Le differenze tra loro non riguardano tanto ciò che promettono, quanto ciò che accettano: quante immagini, se è consentito un video di riferimento, se include l'audio e quanto può durare il risultato. Questa guida li elenca a partire dal catalogo Reelina aggiornato a ottobre 2026, con il prezzo di una generazione in coin alla durata predefinita di ciascun modello.
Come funziona il reference-to-video
Carichi i riferimenti — di solito un'immagine per ogni soggetto — e scrivi un prompt che descrive cosa fanno. Il modello non viene addestrato sui tuoi riferimenti: li legge solo per quella singola generazione. Questo comporta due conseguenze:
- La coerenza nasce dal riutilizzo degli stessi riferimenti. Conserva un ritratto nitido di ogni personaggio e usalo per ogni scena.
- Un soggetto per immagine funziona meglio. Uno sfondo neutro e una luce uniforme evitano che il modello riporti quell'illuminazione nella scena.
I modelli, in base a cosa accettano
| Modello | Coin | Riferimenti | Durata |
|---|---|---|---|
| PixVerse v6 Reference-to-Video | 38 | Riferimenti | 1–15 s |
| PixVerse c1 Reference-to-Video | 46 | Riferimenti | 1–15 s |
| Wan 3.0 Reference-to-Video | 60 | Riferimenti | 2–30 s |
| Vidu Q3 Reference-to-Video | 64 | Riferimenti, audio opzionale | — |
| Seedance 2.0 Mini Reference-to-Video | 68 | Fino a 9 immagini, 3 video (15 s totali), audio di riferimento | 4–15 s |
| Grok Imagine Video Reference-to-Video | 76 | 1–7 immagini (persone, oggetti, stili) | — |
| Wan 3.0 Prime Reference-to-Video | 92 | Riferimenti | 2–30 s |
| Vidu Q2 Reference-to-Video | 96 | 1–7 soggetti, audio opzionale | — |
| Kling Video O3 Std Reference-to-Video | 108 | "Elementi" soggetto | 3–15 s |
| Seedance 2.0 Fast Reference-to-Video | 110 | Fino a 9 immagini, 3 video, audio di riferimento | 4–15 s |
| MiniMax H3 Fast Reference-to-Video | 112 | Riferimenti | 5–15 s (8 s predefiniti) |
| Grok Imagine Video v1.5 Reference-to-Video | 122 | 1–7 immagini | — |
| Vidu Q2-Pro Reference-to-Video | 128 | 1–7 soggetti, audio opzionale | — |
| Seedance 2.0 Reference-to-Video | 136 | Fino a 9 immagini, 3 video, audio di riferimento | 4–15 s |
| Kling Video O3 Pro Reference-to-Video | 144 | "Elementi" soggetto | 3–15 s |
| Wan 2.7 Reference-to-Video | 152 | Fino a 3 video — uno per personaggio, che può portare con sé la propria voce | — |
| MiniMax H3 Reference-to-Video | 152 | Riferimenti | 4–15 s (8 s predefiniti) |
| Seedance 2.5 Reference-to-Video | 204 | Fino a 30 immagini, 10 video, audio di riferimento | 4–30 s |
| Veo 3.1 Reference-to-Video | 484 | Riferimenti, audio opzionale | 8 s |
Nel catalogo trovi anche: Vidu Q3-Mix (160), Gemini Omni Flash (204), HappyHorse 1.1 (106) e 1.0 (212), Vidu Reference-to-Video 2.0 (304), Vidu Q1 (516) e Vidu Reference-to-Video Q1 (606). "—" indica che la durata è fissata dal modello e non è selezionabile. I prezzi si riferiscono alla durata predefinita di ciascun modello; i clip più lunghi costano proporzionalmente di più, e il costo esatto viene mostrato prima di generare.
Quale scegliere
- Il modo più economico per provare l'idea: PixVerse v6 (38 coin) oppure Wan 3.0 (60 coin, fino a 30 secondi).
- Un cast di personaggi più un riferimento in movimento: Seedance 2.0 — fino a 9 immagini e 3 video di riferimento, con audio di riferimento. Fai la bozza con Mini (68), finisci con il modello completo (136).
- Scene lunghe e ricche di riferimenti: Seedance 2.5 — fino a 30 immagini e 10 video, clip fino a 30 secondi.
- Personaggi che devono mantenere la propria voce: Wan 2.7, dove ogni video di riferimento corrisponde a un personaggio e può portare la sua voce.
- Fino a sette soggetti distinti: Vidu Q2 / Q2-Pro oppure Grok Imagine Video.
- L'approccio di Kling: Kling Video O3, con gli "elementi" soggetto.
Immagini di riferimento anche per le immagini
Se quello che ti serve è un fermo immagine, Nano Banana 2 Reference-to-Image (24 coin) e la sua versione Lite (13 coin) costruiscono un'immagine a partire dai riferimenti, ed entrambi accettano anche un clip video come riferimento.
Come farlo su Reelina
- Apri lo Video Studio e scegli un modello reference-to-video — per esempio Seedance 2.0 Reference-to-Video oppure Seedance 2.5 Reference-to-Video.
- Carica i tuoi riferimenti e descrivi la scena: chi fa cosa, dove e come si muove la telecamera.
- Controlla il prezzo mostrato sul pulsante e genera. Conserva i riferimenti: è il loro riutilizzo che garantisce la coerenza della scena successiva.
Per un episodio intero piuttosto che una singola scena, il generatore di AI drama fa tutto questo per te: assegna a ogni personaggio un ritratto di riferimento e prosegue ogni scena a partire dall'ultimo fotogramma di quella precedente.
FAQ
Cos'è l'AI reference-to-video? Un modello video che accetta diversi input di riferimento — immagini e, in alcuni modelli, anche video e audio — e genera una nuova scena che mantiene quei soggetti, invece di animare una singola immagine di partenza.
Quante immagini di riferimento posso usare? Dipende dal modello: fino a 30 su Seedance 2.5, 9 su Seedance 2.0, 1–7 su Vidu Q2 e Grok Imagine Video. Wan 2.7, invece, accetta fino a 3 video di riferimento.
Qual è il modello reference-to-video più economico? Su Reelina, PixVerse v6 Reference-to-Video, a 38 coin per generazione.
Il modello impara il mio volto? No. I riferimenti vengono letti solo per quella singola generazione; non viene addestrato nulla. La coerenza nasce dal fornire gli stessi riferimenti a ogni scena.
Serve una API key? No. Ogni modello funziona nel browser utilizzando il saldo coin di Reelina. Non esiste un piano gratuito.
Try it yourself
Every model on one credit balance, straight in your browser. No install, no watermark.
Start creatingKeep reading
Seedance 2.0 vs Kling 3.0: Specifiche, Prezzi e Quando UsarliSeedance 2.0 contro Kling 3.0: livelli, durata dei clip, formati, audio, reference-to-video contro multi-shot e motion control, e costo al secondo in coin.
Kling 3.0 vs Veo 3.1: Durata delle Clip, Audio e Costi a ConfrontoKling 3.0 vs Veo 3.1: clip da 3–15 s contro 4, 6 o 8 s, formati, risoluzioni, quali livelli generano audio e costo per secondo di ogni variante.
Seedance vs Seedream: di quale modello ByteDance hai bisogno?Seedance crea video, Seedream crea immagini — entrambi di ByteDance. Varianti, dimensioni, audio e prezzi in coin a confronto, e come usarli insieme.
