Referência para Vídeo com IA: Cada Modelo, Seus Limites e Seu Preço
A IA de referência para vídeo mantém seus personagens, produtos e vozes num novo plano. Todos os modelos da Reelina, quantas referências cada um aceita e o preço de cada um.

Imagem para vídeo começa a partir de uma única foto. Referência para vídeo é diferente: você fornece ao modelo várias coisas para manter — um personagem, um produto, uma roupa, um lugar, às vezes uma voz — e ele constrói um novo plano em torno delas. É a coisa mais próxima de uma "escolha de elenco" que a IA de vídeo tem a oferecer.
A Reelina roda 26 modelos de referência para vídeo. Eles diferem menos no que prometem do que no que aceitam: quantas imagens, se um vídeo de referência é permitido, se o som vem incluído e qual pode ser a duração do resultado. Este guia os lista a partir do catálogo da Reelina em outubro de 2026, com o preço de uma geração em moedas na duração padrão de cada modelo.
Como funciona a referência para vídeo
Você envia referências — geralmente uma imagem por assunto — e escreve um prompt que descreve o que elas fazem. O modelo não é treinado com suas referências; ele as lê apenas para aquela geração específica. Isso tem duas consequências:
- A consistência vem de reutilizar as mesmas referências. Mantenha um retrato limpo de cada personagem e use-o em todos os planos.
- Um assunto por imagem funciona melhor. Um fundo neutro e luz uniforme evitam que o modelo copie a iluminação para dentro da cena.
Os modelos, pelo que aceitam
| Modelo | Moedas | Referências | Duração |
|---|---|---|---|
| PixVerse v6 Reference-to-Video | 38 | Referências | 1–15 s |
| PixVerse c1 Reference-to-Video | 46 | Referências | 1–15 s |
| Wan 3.0 Reference-to-Video | 60 | Referências | 2–30 s |
| Vidu Q3 Reference-to-Video | 64 | Referências, áudio opcional | — |
| Seedance 2.0 Mini Reference-to-Video | 68 | Até 9 imagens, 3 vídeos (15 s no total), áudio de referência | 4–15 s |
| Grok Imagine Video Reference-to-Video | 76 | 1–7 imagens (pessoas, objetos, estilos) | — |
| Wan 3.0 Prime Reference-to-Video | 92 | Referências | 2–30 s |
| Vidu Q2 Reference-to-Video | 96 | 1–7 assuntos, áudio opcional | — |
| Kling Video O3 Std Reference-to-Video | 108 | "Elementos" de assunto | 3–15 s |
| Seedance 2.0 Fast Reference-to-Video | 110 | Até 9 imagens, 3 vídeos, áudio de referência | 4–15 s |
| MiniMax H3 Fast Reference-to-Video | 112 | Referências | 5–15 s (8 s padrão) |
| Grok Imagine Video v1.5 Reference-to-Video | 122 | 1–7 imagens | — |
| Vidu Q2-Pro Reference-to-Video | 128 | 1–7 assuntos, áudio opcional | — |
| Seedance 2.0 Reference-to-Video | 136 | Até 9 imagens, 3 vídeos, áudio de referência | 4–15 s |
| Kling Video O3 Pro Reference-to-Video | 144 | "Elementos" de assunto | 3–15 s |
| Wan 2.7 Reference-to-Video | 152 | Até 3 vídeos — um por personagem, podendo levar sua própria voz | — |
| MiniMax H3 Reference-to-Video | 152 | Referências | 4–15 s (8 s padrão) |
| Seedance 2.5 Reference-to-Video | 204 | Até 30 imagens, 10 vídeos, áudio de referência | 4–30 s |
| Veo 3.1 Reference-to-Video | 484 | Referências, áudio opcional | 8 s |
Também no catálogo: Vidu Q3-Mix (160), Gemini Omni Flash (204), HappyHorse 1.1 (106) e 1.0 (212), Vidu Reference-to-Video 2.0 (304), Vidu Q1 (516) e Vidu Reference-to-Video Q1 (606). "—" significa que a duração é fixada pelo modelo em vez de escolhida. Os preços são para a duração padrão de cada modelo; clipes mais longos custam proporcionalmente mais, e o custo exato é mostrado antes de você gerar.
Qual escolher
- Forma mais barata de testar a ideia: PixVerse v6 (38 moedas) ou Wan 3.0 (60 moedas, até 30 segundos).
- Um elenco de personagens mais uma referência em movimento: Seedance 2.0 — até 9 imagens e 3 vídeos de referência, com áudio de referência. Faça o rascunho no Mini (68) e finalize no modelo completo (136).
- Planos longos e ricos em referências: Seedance 2.5 — até 30 imagens e 10 vídeos, clipes de até 30 segundos.
- Personagens que devem manter a própria voz: Wan 2.7, em que cada vídeo de referência é um personagem e pode levar sua própria voz.
- Até sete assuntos distintos: Vidu Q2 / Q2-Pro ou Grok Imagine Video.
- A abordagem da Kling para isso: Kling Video O3, com "elementos" de assunto.
Imagens de referência também para imagens
Se o que você precisa é de uma imagem estática, o Nano Banana 2 Reference-to-Image (24 moedas) e sua versão Lite (13 moedas) constroem uma imagem a partir de referências, e ambos aceitam um clipe de vídeo como referência.
Como fazer isso na Reelina
- Abra o Video Studio e escolha um modelo de referência para vídeo — por exemplo, Seedance 2.0 Reference-to-Video ou Seedance 2.5 Reference-to-Video.
- Envie suas referências e descreva o plano: quem faz o quê, onde, e como a câmera se move.
- Confira o preço mostrado no botão e gere. Guarde as referências — reutilizá-las é o que mantém o próximo plano consistente.
Para um episódio inteiro em vez de um único plano, o gerador de dramas com IA faz isso por você: ele escala cada personagem como um retrato de referência e continua cada plano a partir do último quadro do anterior.
Perguntas frequentes
O que é IA de referência para vídeo? Um modelo de vídeo que recebe várias entradas de referência — imagens, e em alguns modelos vídeos e áudio — e gera um novo plano que mantém esses assuntos, em vez de animar uma única imagem inicial.
Quantas imagens de referência posso usar? Depende do modelo: até 30 no Seedance 2.5, 9 no Seedance 2.0, 1–7 no Vidu Q2 e no Grok Imagine Video. Já o Wan 2.7 aceita até 3 vídeos de referência em vez de imagens.
Qual é o modelo de referência para vídeo mais barato? Na Reelina, o PixVerse v6 Reference-to-Video, a 38 moedas por geração.
O modelo aprende meu rosto? Não. As referências são lidas apenas para aquela geração; nada é treinado. A consistência vem de usar as mesmas referências em todos os planos.
Preciso de uma chave de API? Não. Todos os modelos funcionam no navegador, usando o saldo de moedas da Reelina. Não há plano gratuito.
Try it yourself
Every model on one credit balance, straight in your browser. No install, no watermark.
Start creatingKeep reading
Seedance vs Seedream: Qual Modelo da ByteDance Você Precisa?O Seedance cria vídeos, o Seedream cria imagens — ambos da ByteDance. Variantes, tamanhos, áudio e preços em moedas lado a lado, além de como usá-los juntos.
Kling 3.0 vs Veo 3.1: Duração dos Clipes, Áudio e Custo ComparadosKling 3.0 vs Veo 3.1: clipes de 3–15 s vs 4, 6 ou 8 s, proporções de tela, resoluções, quais níveis geram som e o custo por segundo de cada variante.
Seedance 2.0 vs Kling 3.0: Especificações, Preços e Quando Usar Cada UmSeedance 2.0 vs Kling 3.0: planos, duração dos clipes, proporções de tela, áudio, reference-to-video vs multi-shot e controle de movimento, e custo por segundo em moedas.
