IA de Referencia a Video: Cada Modelo, Sus Límites y Su Precio
La IA de referencia a video mantiene a tus personajes, productos y voces en una nueva toma. Todos los modelos de Reelina, cuántas referencias admite cada uno y su precio.

Image-to-video parte de una sola imagen. La referencia a video es distinta: le das al modelo varias cosas que debe conservar —un personaje, un producto, un vestuario, un lugar, a veces una voz— y él construye una nueva toma a partir de ellas. Es lo más parecido a un casting que existe en el video con IA.
Reelina ofrece 26 modelos de referencia a video. Se diferencian menos por lo que prometen que por lo que aceptan: cuántas imágenes, si se permite un video de referencia, si viene con sonido y cuánto puede durar el resultado. Esta guía los enumera a partir del catálogo de Reelina a octubre de 2026, con el precio de una generación en monedas a la duración predeterminada de cada modelo.
Cómo funciona la referencia a video
Subes las referencias —normalmente una imagen por sujeto— y escribes un prompt que indica qué hacen. El modelo no se entrena con tus referencias; las lee únicamente para esa generación. Esto tiene dos consecuencias:
- La consistencia viene de reutilizar las mismas referencias. Guarda un retrato limpio de cada personaje y úsalo en cada toma.
- Lo mejor es un sujeto por imagen. Un fondo liso y una luz uniforme evitan que el modelo copie esa iluminación en la escena.
Los modelos, según lo que aceptan
| Modelo | Monedas | Referencias | Duración |
|---|---|---|---|
| PixVerse v6 Reference-to-Video | 38 | Referencias | 1–15 s |
| PixVerse c1 Reference-to-Video | 46 | Referencias | 1–15 s |
| Wan 3.0 Reference-to-Video | 60 | Referencias | 2–30 s |
| Vidu Q3 Reference-to-Video | 64 | Referencias, audio opcional | — |
| Seedance 2.0 Mini Reference-to-Video | 68 | Hasta 9 imágenes, 3 videos (15 s en total), audio de referencia | 4–15 s |
| Grok Imagine Video Reference-to-Video | 76 | 1–7 imágenes (personas, objetos, estilos) | — |
| Wan 3.0 Prime Reference-to-Video | 92 | Referencias | 2–30 s |
| Vidu Q2 Reference-to-Video | 96 | 1–7 sujetos, audio opcional | — |
| Kling Video O3 Std Reference-to-Video | 108 | «Elementos» de sujeto | 3–15 s |
| Seedance 2.0 Fast Reference-to-Video | 110 | Hasta 9 imágenes, 3 videos, audio de referencia | 4–15 s |
| MiniMax H3 Fast Reference-to-Video | 112 | Referencias | 5–15 s (8 s por defecto) |
| Grok Imagine Video v1.5 Reference-to-Video | 122 | 1–7 imágenes | — |
| Vidu Q2-Pro Reference-to-Video | 128 | 1–7 sujetos, audio opcional | — |
| Seedance 2.0 Reference-to-Video | 136 | Hasta 9 imágenes, 3 videos, audio de referencia | 4–15 s |
| Kling Video O3 Pro Reference-to-Video | 144 | «Elementos» de sujeto | 3–15 s |
| Wan 2.7 Reference-to-Video | 152 | Hasta 3 videos, uno por personaje, que puede incluir su voz | — |
| MiniMax H3 Reference-to-Video | 152 | Referencias | 4–15 s (8 s por defecto) |
| Seedance 2.5 Reference-to-Video | 204 | Hasta 30 imágenes, 10 videos, audio de referencia | 4–30 s |
| Veo 3.1 Reference-to-Video | 484 | Referencias, audio opcional | 8 s |
También en el catálogo: Vidu Q3-Mix (160), Gemini Omni Flash (204), HappyHorse 1.1 (106) y 1.0 (212), Vidu Reference-to-Video 2.0 (304), Vidu Q1 (516) y Vidu Reference-to-Video Q1 (606). «—» significa que la duración la fija el modelo en lugar de elegirse. Los precios corresponden a la duración predeterminada de cada modelo; los clips más largos cuestan proporcionalmente más, y el coste exacto se muestra antes de generar.
Cuál elegir
- La forma más barata de probar la idea: PixVerse v6 (38 monedas) o Wan 3.0 (60 monedas, hasta 30 segundos).
- Un reparto de personajes más una referencia en movimiento: Seedance 2.0, con hasta 9 imágenes y 3 videos de referencia, con audio de referencia. Haz el borrador con Mini (68) y termina con el modelo completo (136).
- Tomas largas con muchas referencias: Seedance 2.5, con hasta 30 imágenes y 10 videos, clips de hasta 30 segundos.
- Personajes que deben conservar su propia voz: Wan 2.7, donde cada video de referencia es un personaje y puede incluir su voz.
- Hasta siete sujetos distintos: Vidu Q2 / Q2-Pro o Grok Imagine Video.
- La propuesta de Kling: Kling Video O3, con «elementos» de sujeto.
Imágenes de referencia también para imágenes
Si lo que necesitas es una imagen fija, Nano Banana 2 Reference-to-Image (24 monedas) y su versión Lite (13 monedas) construyen una imagen a partir de referencias, y ambas aceptan un clip de video como referencia.
Cómo hacerlo en Reelina
- Abre el Video Studio y elige un modelo de referencia a video; por ejemplo, Seedance 2.0 Reference-to-Video o Seedance 2.5 Reference-to-Video.
- Sube tus referencias y describe la toma: quién hace qué, dónde y cómo se mueve la cámara.
- Revisa el precio que aparece en el botón y genera. Conserva las referencias: reutilizarlas es lo que mantiene la coherencia en la siguiente toma.
Para un episodio completo en lugar de una sola toma, el generador de dramas con IA hace esto por ti: convierte a cada personaje en un retrato de referencia y continúa cada toma a partir del último fotograma de la anterior.
Preguntas frecuentes
¿Qué es la IA de referencia a video? Es un modelo de video que recibe varias entradas de referencia —imágenes y, en algunos modelos, videos y audio— y genera una nueva toma que conserva esos sujetos, en lugar de animar una sola imagen inicial.
¿Cuántas imágenes de referencia puedo usar? Depende del modelo: hasta 30 en Seedance 2.5, 9 en Seedance 2.0, y 1–7 en Vidu Q2 y Grok Imagine Video. Wan 2.7, en cambio, admite hasta 3 videos de referencia.
¿Cuál es el modelo de referencia a video más económico? En Reelina, PixVerse v6 Reference-to-Video, con 38 monedas por generación.
¿El modelo aprende mi rostro? No. Las referencias se leen solo para esa generación; no se entrena nada. La consistencia se consigue usando las mismas referencias en cada toma.
¿Necesito una clave de API? No. Todos los modelos funcionan en el navegador con un único saldo de monedas de Reelina. No hay un plan gratuito.
Try it yourself
Every model on one credit balance, straight in your browser. No install, no watermark.
Start creatingKeep reading
Seedance 2.0 vs Kling 3.0: especificaciones, precios y cuándo usar cada unoSeedance 2.0 vs Kling 3.0: planes, duración de clip, relaciones de aspecto, audio, referencia a video frente a multi-toma y control de movimiento, y coste por segundo en monedas.
Kling 3.0 vs Veo 3.1: Duración de clips, audio y coste comparadosKling 3.0 vs Veo 3.1: clips de 3 a 15 s frente a 4, 6 u 8 s, relaciones de aspecto, resoluciones, qué niveles incluyen sonido y coste por segundo de cada variante.
Seedance vs Seedream: ¿Qué modelo de ByteDance necesitas?Seedance genera video, Seedream genera imágenes — ambos de ByteDance. Variantes, tamaños, audio y precios en monedas comparados, y cómo usarlos juntos.
