Aigest.
Newsy

Google DeepMind: Generatory wideo zawierają "modele świata" kluczowe dla wizji komputerowej

Google DeepMind wprowadza GenCeption, nowy model wykorzystujący generatory wideo do zadań wizji komputerowej, osiągając wyniki porównywalne z najnowocześniejszymi rozwiązaniami przy minimalnej ilości danych treningowych.

RA

Udostępnij
Google DeepMind: Generatory wideo zawierają "modele świata" kluczowe dla wizji komputerowej
Fot. The Decoder

Nowy model GenCeption od Google DeepMind wykorzystuje wstępnie wytrenowany model generowania wideo jako podstawę do klasycznych zadań wizji komputerowej. Osiąga on najnowocześniejsze wyniki w estymacji głębi, segmentacji i estymacji pozycji 3D, wymagając przy tym bardzo niewielkiej ilości danych treningowych. Badacze z DeepMind argumentują, że duże modele tekst-na-wideo mogą wypełnić lukę w wizji komputerowej, podobnie jak modele językowe stały się wszechstronnymi systemami przetwarzania.

Potencjał modeli generatywnych w wizji komputerowej

Modele językowe stały się wszechstronnymi systemami przetwarzania niemalże jako produkt uboczny nauki przewidywania kolejnego słowa. Zadanie to wymagało od modeli przyswojenia gramatyki, wiedzy o świecie i relacji kontekstowych podczas treningu, co jest dominującym wyjaśnieniem ich zdolności emergentnych. Wizja komputerowa nadal nie posiada równoważnej metody treningowej, a w tej dziedzinie dominują wyspecjalizowane modele, takie jak "Segment Anything" do segmentacji czy "Depth Anything" do estymacji głębi, każdy z własną architekturą.

Badacze z DeepMind sugerują, że duże modele tekst-na-wideo mogą wypełnić tę lukę. Generowanie realistycznych filmów wymaga zrozumienia geometrii przestrzennej sceny, sposobu poruszania się obiektów oraz podstaw fizyki. Modele te wykorzystują również opisy tekstowe podczas treningu, co łączy język z treścią wizualną. Mogą być trenowane na ogromnych zbiorach danych, ponieważ etykietowanie danych jest stosunkowo tanie.

Architektura i efektywność GenCeption

GenCeption bazuje na otwartym modelu wideo Wan2.1 firmy Alibaba. Główną zmianą jest prostsza architektura. Podczas gdy modele dyfuzyjne zazwyczaj generują wideo z szumu poprzez wiele małych kroków, GenCeption produkuje przewidywanie w jednym przejściu do przodu, co czyni go wystarczająco szybkim do praktycznych zadań wizji komputerowej.

Badacze zastosowali prostą metodę, aby jeden model mógł obsługiwać wiele zadań. GenCeption reprezentuje każdy wynik jako standardowy obraz RGB z trzema kanałami, niezależnie od tego, czy jest to mapa głębi, mapa normalnych powierzchni, czy maska segmentacji. Konwertuje również ruch kamery na reprezentację obrazu. Podpowiedź tekstowa informuje model, które zadanie ma wykonać, podobnie jak instrukcja podana chatbotowi. Zespół dodał moduły do trenowania dla zadań takich jak przewidywanie punktów kluczowych 3D, które nie generują obrazów.

Trening wykorzystuje jedną funkcję straty dla wszystkich zadań. Zamiast zmieniać architekturę dla każdego zadania, badacze przetwarzają dane treningowe, aby uwzględnić specyficzne wymagania zadania. Większość danych treningowych pochodziła ze zbioru syntetycznego zawierającego zaledwie 7500 filmów. Zespół połączył 800 cyfrowych modeli ludzi z 200 sekwencjami ruchu z zestawu danych przechwytywania ruchu, a następnie wyrenderował wyniki w Blenderze z różnymi tłami i kątami kamery. Prawdziwe filmy zostały użyte tylko do segmentacji kierowanej językiem.

Wyniki i przyszłe perspektywy

Według badania, GenCeption dorównuje lub przewyższa najnowocześniejsze wyniki w wielu benchmarkach, pomimo używania jednej architektury dla każdego zadania. Jego estymacje głębi odpowiadają tym z wyspecjalizowanych modeli, takich jak DepthAnything 3. GenCeption przewyższa NormalCrafter i Lotus-2 w estymacji normalnych powierzchni, a także Genmo i TRAM w rozpoznawaniu pozycji 3D. W złożonej segmentacji kierowanej językiem dorównuje Meta SAM 3 w połączeniu z Gemini 3.5 Flash.

Modele takie jak D4RT i VGGT Omega były trenowane na milionach filmów. GenCeption osiąga podobne wyniki, używając od 7 do 500 razy mniej danych. W testach przeprowadzonych w tych samych warunkach, wstępne trenowanie na generowaniu wideo przewyższa również metody takie jak V-JEPA i VideoMAE V2. Autorzy przypisują te wyniki zadaniu generowania, a nie tylko objętości danych, argumentując, że generowanie wideo pomaga modelom uczyć się użytecznych reprezentacji przestrzeni i ruchu.

GenCeption był trenowany niemal wyłącznie na syntetycznych filmach przedstawiających jedną osobę naraz, ale nadal działa na prawdziwych filmach z kilkoma osobami w kadrze, a także na niezwiązanych kategoriach, takich jak zwierzęta i roboty humanoidalne. Według badania, niektóre wyniki zawierają więcej szczegółów niż renderingi z Blendera użyte do treningu, potrafiąc zachować wąsy kota i krawędzie pojedynczych pasm włosów.

Wspólne trenowanie dla wszystkich zadań negatywnie wpływa na estymację punktów kluczowych 3D. Badacze podejrzewają, że dodatkowe komponenty potrzebne do tego zadania kolidują z mechanizmami nauczonymi przez model bazowy podczas wstępnego trenowania. Ich wniosek jest taki, że należy wprowadzać jak najmniej zmian w oryginalnej architekturze modelu. Prędkość przetwarzania również wymaga poprawy; mniejszy model potrzebuje około sześciu sekund na przetworzenie wideo z 81 klatkami, podczas gdy większy model z 14 miliardami parametrów zajmuje około dziesięciu sekund.

Autorzy odrzucają pogląd, że generatory wideo są jedynie narzędziami rozrywkowymi. Argumentują, że te modele już zawierają rodzaj uniwersalnego "modelu świata", który mógłby wspierać model fundamentowy dla wizji komputerowej. Taki system mógłby pełnić tę samą rolę w przetwarzaniu obrazu, jaką duże modele językowe pełnią w tekście. To, czy takie ramy się utrzymają, jest przedmiotem debaty. Międzynarodowy zespół badawczy niedawno zaproponował jednolitą definicję z OpenWorldLib i wyraźnie wykluczył modele tekst-na-wideo, ponieważ brakuje im informacji zwrotnej ze świata rzeczywistego. Były główny naukowiec AI w Meta, Yann LeCun, poszedł dalej, twierdząc, że generatywne modele wideo są ślepą uliczką. V-JEPA 2 firmy Meta podąża za alternatywą, którą on propagował, przewidując abstrakcyjne koncepcje zamiast pikseli. Benchmark z Uniwersytetu Tsinghua wskazuje na ograniczenia przewidywania pikseli. Sora 2, Seedance 2.0 i Veo 3.1 wielokrotnie nie zdawały testów podstawowej fizyki i logiki, nawet jeśli ich wyniki wyglądały przekonująco.

GenCeption wykorzystuje generowanie wideo w węższym celu. Badacze nie proszą Wan2.1 o przewidywanie, jak zachowa się świat. Używają go do ekstrakcji cech dla konkretnych zadań, takich jak estymacja głębi i segmentacja, gdzie te nauczone cechy mogą przewyższać wyspecjalizowane systemy. Google DeepMind bada również inne podejście z Genie 3, które buduje interaktywne środowiska 3D do trenowania agentów AI. Rozwój GenCeption wskazuje na rosnące znaczenie modeli generatywnych jako fundamentu dla bardziej zaawansowanych systemów AI, co może prowadzić do znaczących postępów w rozumieniu i interakcji maszyn z otaczającym światem, otwierając nowe możliwości dla wielu branż.

Źródło: the-decoder.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Google DeepMind i Isomorphic Labs przedstawiają wspólne podejście do bioodporności i modeli AI
Google DeepMind i A24 łączą siły w partnerstwie badawczym
Christopher Nolan o sztucznej inteligencji: „To koń trojański, o którym wszyscy wiedzą, że Grecy są w środku”
Sztuczna inteligencja w autoryzacji medycznej: szansa na usprawnienie czy ryzyko dla pacjentów?
Applied Computing pozyskuje 20 mln dolarów na model AI dla przemysłu naftowo-gazowego
OpenAI wykorzystuje sztuczną inteligencję do testowania bezpieczeństwa własnych modeli

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.