Reference-to-Video-KI: Jedes Modell, seine Grenzen und sein Preis
Reference-to-Video-KI behält Charaktere, Produkte und Stimmen in einer neuen Szene bei. Dieser Überblick zeigt alle Modelle auf Reelina, wie viele Referenzen sie jeweils benötigen und was sie kosten.

Image-to-Video startet von einem einzigen Bild. Reference-to-Video funktioniert anders: Du gibst dem Modell mehrere Dinge vor, die erhalten bleiben sollen – einen Charakter, ein Produkt, ein Outfit, einen Ort, manchmal auch eine Stimme – und es baut eine neue Szene darum herum auf. Das kommt dem Casting am nächsten, was es bei KI-Video gibt.
Reelina bietet 26 Reference-to-Video-Modelle. Sie unterscheiden sich weniger in dem, was sie versprechen, als in dem, was sie akzeptieren: wie viele Bilder, ob ein Referenz-Video erlaubt ist, ob Ton mitgeliefert wird und wie lang das Ergebnis sein kann. Dieser Leitfaden listet sie aus dem Reelina-Katalog mit Stand Oktober 2026 auf, mit dem Preis einer Generierung in Coins bei der jeweiligen Standardlänge des Modells.
Wie Reference-to-Video funktioniert
Du lädst Referenzen hoch – meist ein Bild pro Motiv – und schreibst einen Prompt, der beschreibt, was sie tun. Das Modell wird nicht mit deinen Referenzen trainiert; es liest sie nur für diese eine Generierung. Das hat zwei Folgen:
- Konsistenz entsteht durch die Wiederverwendung derselben Referenzen. Halte ein saubere Porträt jedes Charakters bereit und verwende es für jede Szene.
- Ein Motiv pro Bild funktioniert am besten. Ein schlichter Hintergrund und gleichmäßiges Licht verhindern, dass das Modell die Beleuchtung in die Szene übernimmt.
Die Modelle – nach dem, was sie akzeptieren
| Modell | Coins | Referenzen | Länge |
|---|---|---|---|
| PixVerse v6 Reference-to-Video | 38 | Referenzen | 1–15 s |
| PixVerse c1 Reference-to-Video | 46 | Referenzen | 1–15 s |
| Wan 3.0 Reference-to-Video | 60 | Referenzen | 2–30 s |
| Vidu Q3 Reference-to-Video | 64 | Referenzen, optionales Audio | — |
| Seedance 2.0 Mini Reference-to-Video | 68 | Bis zu 9 Bilder, 3 Videos (insgesamt 15 s), Referenz-Audio | 4–15 s |
| Grok Imagine Video Reference-to-Video | 76 | 1–7 Bilder (Personen, Objekte, Stile) | — |
| Wan 3.0 Prime Reference-to-Video | 92 | Referenzen | 2–30 s |
| Vidu Q2 Reference-to-Video | 96 | 1–7 Motive, optionales Audio | — |
| Kling Video O3 Std Reference-to-Video | 108 | Motiv-„Elemente“ | 3–15 s |
| Seedance 2.0 Fast Reference-to-Video | 110 | Bis zu 9 Bilder, 3 Videos, Referenz-Audio | 4–15 s |
| MiniMax H3 Fast Reference-to-Video | 112 | Referenzen | 5–15 s (Standard 8 s) |
| Grok Imagine Video v1.5 Reference-to-Video | 122 | 1–7 Bilder | — |
| Vidu Q2-Pro Reference-to-Video | 128 | 1–7 Motive, optionales Audio | — |
| Seedance 2.0 Reference-to-Video | 136 | Bis zu 9 Bilder, 3 Videos, Referenz-Audio | 4–15 s |
| Kling Video O3 Pro Reference-to-Video | 144 | Motiv-„Elemente“ | 3–15 s |
| Wan 2.7 Reference-to-Video | 152 | Bis zu 3 Videos – eines pro Charakter, das dessen Stimme enthalten kann | — |
| MiniMax H3 Reference-to-Video | 152 | Referenzen | 4–15 s (Standard 8 s) |
| Seedance 2.5 Reference-to-Video | 204 | Bis zu 30 Bilder, 10 Videos, Referenz-Audio | 4–30 s |
| Veo 3.1 Reference-to-Video | 484 | Referenzen, optionales Audio | 8 s |
Außerdem im Katalog: Vidu Q3-Mix (160), Gemini Omni Flash (204), HappyHorse 1.1 (106) und 1.0 (212), Vidu Reference-to-Video 2.0 (304), Vidu Q1 (516) und Vidu Reference-to-Video Q1 (606). „—“ bedeutet, dass die Länge vom Modell vorgegeben und nicht wählbar ist. Die Preise gelten für die jeweilige Standardlänge des Modells; längere Clips kosten proportional mehr, und die genauen Kosten werden vor der Generierung angezeigt.
Welches Modell passt
- Günstigster Einstieg zum Ausprobieren: PixVerse v6 (38 Coins) oder Wan 3.0 (60 Coins, bis zu 30 Sekunden).
- Eine ganze Besetzung plus bewegte Referenz: Seedance 2.0 – bis zu 9 Bilder und 3 Referenzvideos, mit Referenz-Audio. Entwürfe mit Mini (68), fertigstellen mit dem vollen Modell (136).
- Lange, referenzreiche Szenen: Seedance 2.5 – bis zu 30 Bilder und 10 Videos, Clips bis zu 30 Sekunden.
- Charaktere, die ihre eigene Stimme behalten sollen: Wan 2.7, bei dem jedes Referenzvideo einen Charakter darstellt und dessen Stimme enthalten kann.
- Bis zu sieben einzelne Motive: Vidu Q2 / Q2-Pro oder Grok Imagine Video.
- Klings Ansatz: Kling Video O3 mit Motiv-„Elementen“.
Referenzbilder auch für Bilder
Wenn du nur ein Standbild brauchst: Nano Banana 2 Reference-to-Image (24 Coins) und seine Lite-Version (13 Coins) erzeugen ein Bild aus Referenzen, und beide akzeptieren auch einen Videoclip als Referenz.
So geht's auf Reelina
- Öffne das Video Studio und wähle ein Reference-to-Video-Modell – zum Beispiel Seedance 2.0 Reference-to-Video oder Seedance 2.5 Reference-to-Video.
- Lade deine Referenzen hoch und beschreibe die Szene: wer macht was, wo, und wie sich die Kamera bewegt.
- Prüfe den auf dem Button angezeigten Preis und generiere. Behalte die Referenzen – ihre Wiederverwendung sorgt dafür, dass die nächste Szene konsistent bleibt.
Für eine ganze Episode statt einer einzelnen Szene übernimmt das der KI-Drama-Generator: Er besetzt jeden Charakter mit einem Referenzporträt und setzt jede Szene am letzten Frame der vorherigen fort.
FAQ
Was ist Reference-to-Video-KI? Ein Videomodell, das mehrere Referenz-Inputs entgegennimmt – Bilder, bei manchen Modellen auch Videos und Audio – und daraus eine neue Szene erzeugt, in der diese Motive erhalten bleiben, statt lediglich ein einzelnes Startbild zu animieren.
Wie viele Referenzbilder kann ich verwenden? Das hängt vom Modell ab: bis zu 30 bei Seedance 2.5, 9 bei Seedance 2.0, 1–7 bei Vidu Q2 und Grok Imagine Video. Wan 2.7 nimmt stattdessen bis zu 3 Referenzvideos.
Welches Reference-to-Video-Modell ist am günstigsten? Auf Reelina ist das PixVerse v6 Reference-to-Video mit 38 Coins pro Generierung.
Lernt das Modell mein Gesicht? Nein. Referenzen werden nur für diese eine Generierung gelesen; es wird nichts trainiert. Konsistenz entsteht dadurch, dass du jeder Szene dieselben Referenzen gibst.
Brauche ich einen API-Schlüssel? Nein. Jedes Modell läuft im Browser über ein gemeinsames Reelina-Coin-Guthaben. Es gibt keine kostenlose Stufe.
Try it yourself
Every model on one credit balance, straight in your browser. No install, no watermark.
Start creatingKeep reading
Seedance vs Seedream: Welches ByteDance-Modell brauchst du?Seedance erstellt Videos, Seedream erstellt Bilder — beide von ByteDance. Varianten, Größen, Audio und Coin-Preise im Vergleich, und wie du sie gemeinsam nutzt.
Kling 3.0 vs Veo 3.1: Clip-Länge, Ton und Kosten im VergleichKling 3.0 vs Veo 3.1: 3–15 s Clips vs 4, 6 oder 8 s, Seitenverhältnisse, Auflösungen, welche Stufen Ton erzeugen und die Kosten pro Sekunde für jede Variante.
Seedance 2.0 vs. Kling 3.0: Specs, Preise und wann man welches nutztSeedance 2.0 vs. Kling 3.0: Stufen, Clip-Länge, Seitenverhältnisse, Audio, Reference-to-Video vs. Multi-Shot und Motion Control sowie die Kosten pro Sekunde in Coins.
