Ile kosztuje krótka pętla wideo z AI
Trzy pętle wideo na tę stronę kosztowały nas ok. 1,6 USD w opłatach za modele. Model wideo zrobił tylko jedną z nich, dwie pozostałe to nieruchomy kadr, mapa głębi i kod.
O co chodzi
Przy usługach 03, 04 i 05 na naszej stronie grają krótkie pętle wideo. Zrobiliśmy je 2 października 2026 r. i poniżej rozliczamy, ile kosztowały, które narzędzia odpadły po drodze i co nadal jest do poprawki.
Co powstało
| Pętla | Długość | Co się rusza | Model wideo |
|---|---|---|---|
| 03 Treści i wideo: wybieg | 7 s | modelka na wybiegu; kod wycina z tego samego ujęcia kadry 9:16, 1:1 i 16:9 | Kling v3 Pro |
| 04 Automatyzacje: tablica odlotów | 8 s | powolny ruch kamery; klapki tablicy układają procesy i napis „RĘCZNIE: 0” | brak |
| 05 Analityka: pokój kontrolny | 8 s | powolny ruch kamery; strumienie liczb, wykres i jedna rekomendacja | brak |
Wszystkie trzy mają 1200 × 1488 px, 24 klatki na sekundę, nie mają dźwięku i ważą od 2,1 do 2,3 MB. Liczby na ekranach w pętli 05 są przykładowe.
Ile to kosztowało
| Pozycja | Model | Koszt |
|---|---|---|
| 9 kadrów bazowych, po 3 warianty na pętlę | nano-banana-2 (6 obrazów), gpt-image-2 (3 obrazy) | ok. 0,6 USD |
| ujęcie do pętli 03, 7 s | Kling v3 Pro, obraz na wideo | 0,98 USD |
| pierwsza próba ujęcia do pętli 03 | Seedance 2.0 Fast | 0 USD, odrzucona |
| 2 mapy głębi do pętli 04 i 05 | Depth Anything v2 | ok. 0,02 USD |
| razem | ok. 1,6 USD |
Kling kosztuje 0,14 USD za sekundę, więc 7 sekund to 0,98 USD. Koszt kadrów policzyliśmy z cennika fal, bo nasz klucz API nie pokazuje historii zużycia. W tabeli nie ma pracy ludzi ani prądu dla komputera, na którym renderował się kod.
Od zapisania konceptu do ostatniego renderu minęło 36 minut. Ten czas odczytaliśmy ze znaczników czasu plików, osobno go nie mierzyliśmy.
Co odrzucił filtr
Ujęcie do pętli 03 najpierw zamówiliśmy w Seedance 2.0. Zadanie wróciło z błędem zasad treści: filtr dostawcy uznał, że kadr przedstawia podobieństwo do realnej osoby („likenesses of real people”). Twarz modelki w kadrze wygenerował model obrazowy, a zadanie i tak nie przeszło. Ten sam kadr bez zmian przyjął Kling.
fal nie nalicza opłat za odrzucone zadania. W rozliczeniu tego nie sprawdziliśmy, z tego samego powodu co wyżej.
Dlaczego dwie pętle bez modelu wideo
Przyjęliśmy zasadę, że model generuje tylko obraz i ruch, a każdy napis, liczbę i ramkę rysuje kod. Literówka w napisie to wtedy poprawka w skrypcie i ponowny render, za który nie płacimy dostawcy modelu.
W pętlach 04 i 05 ruch to powolna jazda kamery, a treść niosą klapki tablicy, liczby i wykres. Do takiego ruchu wystarczy mapa głębi: model ocenia, co na kadrze jest bliżej, a co dalej, i skrypt przesuwa te warstwy z różną prędkością (to tak zwana paralaksa 2.5D). Dwie mapy kosztowały razem ok. 2 centy. Tablica 22 × 10 klapek, strumienie liczb i wykres to grafika z Pythona, nakładana klatka po klatce.
Pętla domyka się z konstrukcji. Skrypt liczy ostatnią klatkę tak, żeby przed kompresją była identyczna z pierwszą.
Co nie wyszło
Marsz w miejscu
W pętli 03 modelka miała przejść wybiegiem w stronę kamery. Kling zrobił raczej marsz z małym podejściem, pauzę w pozie i powrót, a postać prawie nie rośnie w kadrze. Przy pętli pierwszy i ostatni kadr ujęcia muszą być takie same, a wtedy taki wynik jest typowy. Poprawka to inny kadr końcowy i nowa generacja za ok. 1 USD. Na razie na stronie jest ta wersja.
Pierwsza wersja pętli
We wrześniu zrobiliśmy cztery pętle w całości modelem wideo, za ok. 1 USD. Miały błędy: przeskok na szwie pętli z dominem, kostki domina padały w złą stronę, a w dwóch pętlach prawie nic się nie ruszało. Wymieniliśmy je wszystkie.
Krawędzie przy paralaksie
Przesuwanie warstw z mapy głębi ciągnie piksele na krawędziach obiektów. Pierwszy render wyginał krawędź tablicy odlotów. Pomogło mocniejsze rozmycie mapy głębi i mniejszy ruch kamery.
Jak sprawdzamy szew pętli
Liczymy średnią różnicę jasności między klatkami w skali 0 do 255. Szew jest niewidoczny, jeśli przejście z ostatniej klatki do pierwszej nie odstaje od zwykłego kroku między sąsiednimi klatkami.
| Pętla | Szew: przedostatnia do pierwszej | Zwykły krok między klatkami | Największy krok |
|---|---|---|---|
| 03 | 3,36 | 2,64 | 6,29 |
| 04 | 2,69 | 2,06 | 3,80 |
| 05 | 2,20 | 2,48 | 3,98 |
Największy krok w pętli 03 to moment, w którym wjeżdża tablica z napisem.
Kiedy model wideo, a kiedy kod
- Model wideo bierzemy, gdy w kadrze musi się ruszać człowiek, tkanina albo woda, czyli coś, czego nie da się udać przesuwaniem warstw jednego zdjęcia.
- Kod wystarcza, gdy ruch to jazda kamery, a treść niosą napisy, liczby i wykresy. Taki tekst zawsze jest poprawny i zmienia się bez nowej generacji.
- Jeśli w kadrze jest fotorealistyczna twarz, miejcie w zapasie drugiego dostawcę. Filtr może odrzucić kadr nawet wtedy, gdy twarz jest wygenerowana.
- Pętla z modelu wideo wymaga takiego samego kadru na początku i na końcu, a to ogranicza ruch. W budżecie zostawcie miejsce na co najmniej jedną powtórkę.
Ograniczenia
To jedna produkcja, trzy pętle i jedna próba z każdym modelem, więc nie porównujemy tu jakości modeli wideo. Ceny pochodzą z cennika fal.ai z października 2026 r. i będą się zmieniać. Pojęcia z tego wpisu wyjaśniamy w słowniku.