Reference to Video AI: każdy model, jego limity i cena
AI typu reference-to-video zachowuje twoje postacie, produkty i głosy w nowym ujęciu. Wszystkie modele na Reelinie, liczba referencji dla każdego i ich ceny.

Image-to-video zaczyna się od jednego obrazu. Reference-to-video działa inaczej: podajesz modelowi kilka elementów do zachowania — postać, produkt, strój, miejsce, czasem głos — a on buduje wokół nich nowe ujęcie. To najbliższa rzecz do castingu, jaką AI wideo ma do zaoferowania.
Reelina udostępnia 26 modeli reference-to-video. Różnią się mniej tym, co obiecują, a bardziej tym, co przyjmują: ile obrazów, czy dopuszczalne jest wideo referencyjne, czy dochodzi do tego dźwięk i jak długi może być wynik. Ta lista pochodzi z katalogu Reeliny według stanu na październik 2026 i podaje cenę jednej generacji w monetach przy domyślnej długości każdego modelu.
Jak działa reference-to-video
Wgrywasz referencje — zwykle jeden obraz na podmiot — i piszesz prompt opisujący, co te podmioty robią. Model nie jest trenowany na twoich referencjach — odczytuje je tylko na potrzeby tej jednej generacji. To ma dwie konsekwencje:
- Spójność wynika z ponownego użycia tych samych referencji. Zachowaj czysty portret każdej postaci i podawaj go do każdego ujęcia.
- Najlepiej działa jeden podmiot na obraz. Jednolite tło i równomierne światło zapobiegają kopiowaniu oświetlenia do scenu.
Modele według tego, co przyjmują
| Model | Monety | Referencje | Długość |
|---|---|---|---|
| PixVerse v6 Reference-to-Video | 38 | Referencje | 1–15 s |
| PixVerse c1 Reference-to-Video | 46 | Referencje | 1–15 s |
| Wan 3.0 Reference-to-Video | 60 | Referencje | 2–30 s |
| Vidu Q3 Reference-to-Video | 64 | Referencje, opcjonalne audio | — |
| Seedance 2.0 Mini Reference-to-Video | 68 | Do 9 obrazów, 3 wideo (łącznie 15 s), audio referencyjne | 4–15 s |
| Grok Imagine Video Reference-to-Video | 76 | 1–7 obrazów (ludzie, przedmioty, style) | — |
| Wan 3.0 Prime Reference-to-Video | 92 | Referencje | 2–30 s |
| Vidu Q2 Reference-to-Video | 96 | 1–7 podmiotów, opcjonalne audio | — |
| Kling Video O3 Std Reference-to-Video | 108 | "Elementy" podmiotu | 3–15 s |
| Seedance 2.0 Fast Reference-to-Video | 110 | Do 9 obrazów, 3 wideo, audio referencyjne | 4–15 s |
| MiniMax H3 Fast Reference-to-Video | 112 | Referencje | 5–15 s (domyślnie 8 s) |
| Grok Imagine Video v1.5 Reference-to-Video | 122 | 1–7 obrazów | — |
| Vidu Q2-Pro Reference-to-Video | 128 | 1–7 podmiotów, opcjonalne audio | — |
| Seedance 2.0 Reference-to-Video | 136 | Do 9 obrazów, 3 wideo, audio referencyjne | 4–15 s |
| Kling Video O3 Pro Reference-to-Video | 144 | "Elementy" podmiotu | 3–15 s |
| Wan 2.7 Reference-to-Video | 152 | Do 3 wideo — jedno na postać, które może nieść jej głos | — |
| MiniMax H3 Reference-to-Video | 152 | Referencje | 4–15 s (domyślnie 8 s) |
| Seedance 2.5 Reference-to-Video | 204 | Do 30 obrazów, 10 wideo, audio referencyjne | 4–30 s |
| Veo 3.1 Reference-to-Video | 484 | Referencje, opcjonalne audio | 8 s |
W katalogu znajdziesz też: Vidu Q3-Mix (160), Gemini Omni Flash (204), HappyHorse 1.1 (106) i 1.0 (212), Vidu Reference-to-Video 2.0 (304), Vidu Q1 (516) i Vidu Reference-to-Video Q1 (606). "—" oznacza, że długość jest ustalona przez model, a nie wybierana. Ceny dotyczą domyślnej długości każdego modelu; dłuższe klipy kosztują proporcjonalnie więcej, a dokładny koszt pojawia się przed generacją.
Który wybrać
- Najtańszy sposób, by sprawdzić ideę: PixVerse v6 (38 monet) lub Wan 3.0 (60 monet, do 30 sekund).
- Obsada postaci plus ruchoma referencja: Seedance 2.0 — do 9 obrazów i 3 wideo referencyjne, z audio referencyjnym. Szkic na Mini (68), finał na pełnym modelu (136).
- Długie ujęcia z dużą liczbą referencji: Seedance 2.5 — do 30 obrazów i 10 wideo, klipy do 30 sekund.
- Postacie, które powinny zachować własny głos: Wan 2.7, gdzie każde wideo referencyjne to jedna postać, która może nieść swój głos.
- Do siedmiu odrębnych podmiotów: Vidu Q2 / Q2-Pro lub Grok Imagine Video.
- Podejście Klinga do tematu: Kling Video O3, z "elementami" podmiotu.
Obrazy referencyjne również dla obrazów
Jeśli potrzebujesz grafiki statycznej, Nano Banana 2 Reference-to-Image (24 monety) i jego wersja Lite (13 monet) budują obraz z referencji, a obie przyjmują klip wideo jako referencję.
Jak to zrobić w Reelinie
- Otwórz Video Studio i wybierz model reference-to-video — na przykład Seedance 2.0 Reference-to-Video lub Seedance 2.5 Reference-to-Video.
- Wgraj swoje referencje i opisz ujęcie: kto co robi, gdzie i jak przesuwa się kamera.
- Sprawdź cenę pokazaną na przycisku i wygeneruj. Zachowaj referencje — ich ponowne użycie zapewnia spójność kolejnego ujęcia.
Dla całego odcinka, a nie jednego ujęcia, generator dramy AI robi to za ciebie: obsadza każdą postać na podstawie portretu referencyjnego i kontynuuje każde ujęcie od ostatniej klatki poprzedniego.
FAQ
Co to jest AI reference-to-video? Model wideo, który przyjmuje kilka wejść referencyjnych — obrazy, a w niektórych modelach także wideo i audio — i generuje nowe ujęcie zachowujące te podmioty, zamiast animować pojedynczy obraz startowy.
Ile obrazów referencyjnych mogę użyć? Zależy to od modelu: do 30 w Seedance 2.5, 9 w Seedance 2.0, 1–7 w Vidu Q2 i Grok Imagine Video. Wan 2.7 przyjmuje natomiast do 3 wideo referencyjnych.
Który model reference-to-video jest najtańszy? Na Reelinie to PixVerse v6 Reference-to-Video za 38 monet za generację.
Czy model uczy się mojej twarzy? Nie. Referencje są odczytywane tylko na potrzeby jednej generacji; nic nie jest trenowane. Spójność wynika z podawania tych samych referencji do każdego ujęcia.
Czy potrzebuję klucza API? Nie. Każdy model działa w przeglądarce na jednym saldzie monet Reeliny. Nie ma darmowego planu.
Try it yourself
Every model on one credit balance, straight in your browser. No install, no watermark.
Start creatingKeep reading
Seedance vs Seedream: który model ByteDance jest Ci potrzebny?Seedance tworzy wideo, Seedream tworzy obrazy — oba modele pochodzą od ByteDance. Warianty, rozmiary, dźwięk i ceny w monetach obok siebie, a także jak używać ich razem.
Kling 3.0 vs Veo 3.1: długość klipów, dźwięk i kosztKling 3.0 vs Veo 3.1: klipy 3–15 s kontra 4, 6 lub 8 s, formaty obrazu, rozdzielczości, które warianty generują dźwięk oraz koszt za sekundę dla każdej opcji.
Seedance 2.0 vs Kling 3.0: Specyfikacje, Ceny i Kiedy Używać KtóregoSeedance 2.0 vs Kling 3.0: warianty, długość klipu, formaty obrazu, dźwięk, reference-to-video vs multi-shot i kontrola ruchu oraz koszt za sekundę w monetach.
