Aigest.
Newsy

Runway dąży do generowania wideo AI w czasie rzeczywistym, niczym transmisja na żywo

Runway intensywnie pracuje nad przekształceniem generowania wideo AI w interaktywny strumień, który użytkownicy mogliby kontrolować w czasie rzeczywistym, eliminując długie oczekiwanie na gotowe klipy.

RA

Udostępnij
Runway dąży do generowania wideo AI w czasie rzeczywistym, niczym transmisja na żywo
Fot. The Decoder

Firma Runway intensywnie pracuje nad przekształceniem procesu generowania wideo za pomocą sztucznej inteligencji w interaktywny strumień, który użytkownicy mogliby kontrolować w czasie rzeczywistym. Zamiast tradycyjnego wprowadzania promptu i oczekiwania na gotowy materiał, celem jest umożliwienie strumieniowania wideo w miarę jego opisywania.

Obecne modele wideo AI działają etapowo: użytkownik wprowadza prompt, czeka od kilku sekund do kilku minut, a następnie otrzymuje gotowy film. Jeśli wynik nie jest zadowalający, proces trzeba rozpocząć od nowa. Runway zauważa, że użytkownicy najwięcej czasu tracą na generowanie i poprawianie wideo, dlatego firma dąży do zminimalizowania czasu potrzebnego na wygenerowanie pierwszej klatki, a następnie strumieniowanie wideo w odpowiedzi na bieżące polecenia.

Rozwój technologii i modele

Runway po raz pierwszy zaprezentowało to podejście w marcu, wprowadzając Runway Characters. Technologia ta wykorzystuje GWM-1, pierwszy „General World Model” firmy, zaprezentowany w grudniu 2025 roku. GWM-1 bazuje na Gen-4.5, generuje wideo klatka po klatce i akceptuje jako elementy sterujące ruchy kamery, polecenia robotów lub dźwięk. Kilka tygodni temu Runway pokazało również Solaris, system, który wykorzystuje Gen-4.5 do generowania interfejsów użytkownika klatka po klatce, reagując na kliknięcia lub wprowadzanie głosowe.

Runway argumentuje, że generowanie w czasie rzeczywistym zmniejsza lukę między pomysłem a jego realizacją. Dzięki natychmiastowej informacji zwrotnej, użytkownicy mogliby poświęcać większość czasu na aktywne sterowanie wideo, zamiast na czekanie. Firma wskazuje także na potencjalne obniżenie kosztów. Szybsze modele zużywają mniej czasu pracy procesora graficznego (GPU), co czyni je bardziej efektywnymi kosztowo. Według Runway, koszt jednostkowy produkcji przy danym poziomie jakości decyduje o tym, które zastosowania są ekonomicznie opłacalne. Natychmiastowe generowanie obniżyłoby ten próg, czyniąc wcześniej nieopłacalne aplikacje realnymi.

Wyzwania i innowacyjne rozwiązania

Kluczowym problemem w podejściach opartych na dużych modelach językowych (LLM) jest to, że małe błędy w generowaniu wideo mogą narastać i prowadzić do poważnych zniekształceń. Model tekstowy może poprawić się w trakcie zdania, ale model wideo buduje każdą klatkę na poprzedniej. Runway rozwiązuje ten problem, trenując model na jego własnych wynikach, a nie tylko na bezbłędnych danych wejściowych. Ma to nauczyć model korygowania własnych odchyleń, zamiast je wzmacniać.

Podobne podejście zastosował startup Decart dla swojego modelu MirageLSD, celowo wystawiając go na wadliwe lub zniekształcone obrazy podczas treningu. Google DeepMind ze swoim modelem świata Genie 3 potrafi utrzymywać spójność interaktywnych światów przez kilka minut przy 24 klatkach na sekundę w rozdzielczości 720p.

Według Runway, generowanie w czasie rzeczywistym przenosi obciążenie obliczeniowe z fazy treningu na fazę użytkowania. Model musi produkować każdą klatkę wystarczająco szybko, aby nadążyć za odtwarzaniem, działając jednocześnie na sprzęcie współdzielonym przez kilka sesji.

Przyszłe zastosowania i współpraca

Runway postrzega interaktywne aplikacje jako największe długoterminowe zastosowanie dla mediów generowanych przez AI. Edukacja, gry i robotyka wymagają wideo, które reaguje tak szybko, jak osoba je oglądająca. Ocena działania robotów czy pojazdów autonomicznych również wymaga środowisk generowanych w czasie rzeczywistym, które natychmiast reagują na nietypowe sytuacje. Runway wcześniej wprowadziło GWM Robotics, wariant GWM-1, który generuje syntetyczne dane treningowe dla robotów.

Waymo stosuje podobne podejście z Waymo World Model, bazującym na Genie 3 i dostosowanym do ruchu drogowego. Pozwala to Waymo symulować sytuacje, których jego flota nigdy nie zaobserwowała, takie jak spotkanie ze słoniem, tornado czy zalana dzielnica mieszkalna. Według Waymo, Waymo Driver pokonuje miliardy mil w wirtualnych światach, zanim napotka scenariusze na drogach publicznych.

W marcu Runway zaprezentowało również podgląd badawczy modelu czasu rzeczywistego opracowanego wspólnie z Nvidia na konferencji GTC producenta chipów. Działa on na platformie Vera Rubin i ma dostarczać pierwszą klatkę w czasie poniżej 100 milisekund. Runway nie ogłosiło jeszcze harmonogramu dostępności tej technologii.

Rozwój generowania wideo AI w czasie rzeczywistym, jak ten prowadzony przez Runway, ma potencjał do fundamentalnej zmiany sposobu, w jaki tworzymy i konsumujemy treści wizualne. Przejście od statycznego generowania do interaktywnego strumieniowania może otworzyć drzwi do zupełnie nowych zastosowań w rozrywce, edukacji i przemyśle, przyspieszając innowacje w wielu sektorach gospodarki cyfrowej.

Źródło: the-decoder.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Nunchux AI prezentuje VC-Attention: Nowy kernel przyspieszający wideo Diffusion Transformers
Google Gemini Flash z nową funkcją agentowego rozumienia wideo: oszczędność tokenów do 88%
Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność
Runway prezentuje Solaris: AI generujące interfejsy w czasie rzeczywistym
Google udostępnia Gemini Omni 1.1 Flash: Większa kontrola nad generowaniem wideo AI
Xiaomi MiLM Plus wprowadza PROVE: Nowe metryki i benchmark do oceny usuwania obiektów z wideo

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.