Google DeepMind: Generatory wideo zawierają "modele świata" kluczowe dla wizji komputerowej
Google DeepMind wprowadza GenCeption, nowy model wykorzystujący generatory wideo do zadań wizji komputerowej, osiągając wyniki porównywalne z najnowocześniejszymi rozwiązaniami przy minimalnej ilości danych treningowych.

Nowy model GenCeption od Google DeepMind wykorzystuje wstępnie wytrenowany model generowania wideo jako podstawę do klasycznych zadań wizji komputerowej. Osiąga on najnowocześniejsze wyniki w estymacji głębi, segmentacji i estymacji pozycji 3D, wymagając przy tym bardzo niewielkiej ilości danych treningowych. Badacze z DeepMind argumentują, że duże modele tekst-na-wideo mogą wypełnić lukę w wizji komputerowej, podobnie jak modele językowe stały się wszechstronnymi systemami przetwarzania.
Potencjał modeli generatywnych w wizji komputerowej
Modele językowe stały się wszechstronnymi systemami przetwarzania niemalże jako produkt uboczny nauki przewidywania kolejnego słowa. Zadanie to wymagało od modeli przyswojenia gramatyki, wiedzy o świecie i relacji kontekstowych podczas treningu, co jest dominującym wyjaśnieniem ich zdolności emergentnych. Wizja komputerowa nadal nie posiada równoważnej metody treningowej, a w tej dziedzinie dominują wyspecjalizowane modele, takie jak "Segment Anything" do segmentacji czy "Depth Anything" do estymacji głębi, każdy z własną architekturą.
Badacze z DeepMind sugerują, że duże modele tekst-na-wideo mogą wypełnić tę lukę. Generowanie realistycznych filmów wymaga zrozumienia geometrii przestrzennej sceny, sposobu poruszania się obiektów oraz podstaw fizyki. Modele te wykorzystują również opisy tekstowe podczas treningu, co łączy język z treścią wizualną. Mogą być trenowane na ogromnych zbiorach danych, ponieważ etykietowanie danych jest stosunkowo tanie.
Architektura i efektywność GenCeption
GenCeption bazuje na otwartym modelu wideo Wan2.1 firmy Alibaba. Główną zmianą jest prostsza architektura. Podczas gdy modele dyfuzyjne zazwyczaj generują wideo z szumu poprzez wiele małych kroków, GenCeption produkuje przewidywanie w jednym przejściu do przodu, co czyni go wystarczająco szybkim do praktycznych zadań wizji komputerowej.
Badacze zastosowali prostą metodę, aby jeden model mógł obsługiwać wiele zadań. GenCeption reprezentuje każdy wynik jako standardowy obraz RGB z trzema kanałami, niezależnie od tego, czy jest to mapa głębi, mapa normalnych powierzchni, czy maska segmentacji. Konwertuje również ruch kamery na reprezentację obrazu. Podpowiedź tekstowa informuje model, które zadanie ma wykonać, podobnie jak instrukcja podana chatbotowi. Zespół dodał moduły do trenowania dla zadań takich jak przewidywanie punktów kluczowych 3D, które nie generują obrazów.
Trening wykorzystuje jedną funkcję straty dla wszystkich zadań. Zamiast zmieniać architekturę dla każdego zadania, badacze przetwarzają dane treningowe, aby uwzględnić specyficzne wymagania zadania. Większość danych treningowych pochodziła ze zbioru syntetycznego zawierającego zaledwie 7500 filmów. Zespół połączył 800 cyfrowych modeli ludzi z 200 sekwencjami ruchu z zestawu danych przechwytywania ruchu, a następnie wyrenderował wyniki w Blenderze z różnymi tłami i kątami kamery. Prawdziwe filmy zostały użyte tylko do segmentacji kierowanej językiem.
Wyniki i przyszłe perspektywy
Według badania, GenCeption dorównuje lub przewyższa najnowocześniejsze wyniki w wielu benchmarkach, pomimo używania jednej architektury dla każdego zadania. Jego estymacje głębi odpowiadają tym z wyspecjalizowanych modeli, takich jak DepthAnything 3. GenCeption przewyższa NormalCrafter i Lotus-2 w estymacji normalnych powierzchni, a także Genmo i TRAM w rozpoznawaniu pozycji 3D. W złożonej segmentacji kierowanej językiem dorównuje Meta SAM 3 w połączeniu z Gemini 3.5 Flash.
Modele takie jak D4RT i VGGT Omega były trenowane na milionach filmów. GenCeption osiąga podobne wyniki, używając od 7 do 500 razy mniej danych. W testach przeprowadzonych w tych samych warunkach, wstępne trenowanie na generowaniu wideo przewyższa również metody takie jak V-JEPA i VideoMAE V2. Autorzy przypisują te wyniki zadaniu generowania, a nie tylko objętości danych, argumentując, że generowanie wideo pomaga modelom uczyć się użytecznych reprezentacji przestrzeni i ruchu.
GenCeption był trenowany niemal wyłącznie na syntetycznych filmach przedstawiających jedną osobę naraz, ale nadal działa na prawdziwych filmach z kilkoma osobami w kadrze, a także na niezwiązanych kategoriach, takich jak zwierzęta i roboty humanoidalne. Według badania, niektóre wyniki zawierają więcej szczegółów niż renderingi z Blendera użyte do treningu, potrafiąc zachować wąsy kota i krawędzie pojedynczych pasm włosów.
Wspólne trenowanie dla wszystkich zadań negatywnie wpływa na estymację punktów kluczowych 3D. Badacze podejrzewają, że dodatkowe komponenty potrzebne do tego zadania kolidują z mechanizmami nauczonymi przez model bazowy podczas wstępnego trenowania. Ich wniosek jest taki, że należy wprowadzać jak najmniej zmian w oryginalnej architekturze modelu. Prędkość przetwarzania również wymaga poprawy; mniejszy model potrzebuje około sześciu sekund na przetworzenie wideo z 81 klatkami, podczas gdy większy model z 14 miliardami parametrów zajmuje około dziesięciu sekund.
Autorzy odrzucają pogląd, że generatory wideo są jedynie narzędziami rozrywkowymi. Argumentują, że te modele już zawierają rodzaj uniwersalnego "modelu świata", który mógłby wspierać model fundamentowy dla wizji komputerowej. Taki system mógłby pełnić tę samą rolę w przetwarzaniu obrazu, jaką duże modele językowe pełnią w tekście. To, czy takie ramy się utrzymają, jest przedmiotem debaty. Międzynarodowy zespół badawczy niedawno zaproponował jednolitą definicję z OpenWorldLib i wyraźnie wykluczył modele tekst-na-wideo, ponieważ brakuje im informacji zwrotnej ze świata rzeczywistego. Były główny naukowiec AI w Meta, Yann LeCun, poszedł dalej, twierdząc, że generatywne modele wideo są ślepą uliczką. V-JEPA 2 firmy Meta podąża za alternatywą, którą on propagował, przewidując abstrakcyjne koncepcje zamiast pikseli. Benchmark z Uniwersytetu Tsinghua wskazuje na ograniczenia przewidywania pikseli. Sora 2, Seedance 2.0 i Veo 3.1 wielokrotnie nie zdawały testów podstawowej fizyki i logiki, nawet jeśli ich wyniki wyglądały przekonująco.
GenCeption wykorzystuje generowanie wideo w węższym celu. Badacze nie proszą Wan2.1 o przewidywanie, jak zachowa się świat. Używają go do ekstrakcji cech dla konkretnych zadań, takich jak estymacja głębi i segmentacja, gdzie te nauczone cechy mogą przewyższać wyspecjalizowane systemy. Google DeepMind bada również inne podejście z Genie 3, które buduje interaktywne środowiska 3D do trenowania agentów AI. Rozwój GenCeption wskazuje na rosnące znaczenie modeli generatywnych jako fundamentu dla bardziej zaawansowanych systemów AI, co może prowadzić do znaczących postępów w rozumieniu i interakcji maszyn z otaczającym światem, otwierając nowe możliwości dla wielu branż.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Szef Google DeepMind: Liderowanie w rozwoju AI to nasz priorytet
Koray Kavukcuoglu, nowy szef Google DeepMind, podkreśla, że bycie na czele innowacji w sztucznej inteligencji jest kluczowe dla firmy, mimo spekulacji o skupieniu na efektywności kosztowej.
Redakcja Aigestwczoraj
Google DeepMind nawiązuje współpracę z twórcami gier w celu prototypowania przełomowej rozgrywki AI
Google DeepMind ogłosiło partnerstwo ze studiami gier, aby wspólnie rozwijać innowacyjne rozwiązania w dziedzinie sztucznej inteligencji, które mają zrewolucjonizować doświadczenia graczy.
Redakcja Aigest21 sie 2026

CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
Max Spero, CEO firmy Pangram, ostrzega przed rosnącym problemem zaufania w internecie, wynikającym z powszechnego użycia treści generowanych przez sztuczną inteligencję. Jego firma oferuje narzędzia do wykrywania AI, aby
Redakcja Aigest9 godz. temu

BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Artykuł analizuje skuteczność tradycyjnych benchmarków w ocenie dużych modeli językowych (LLM), wprowadzając koncepcję BenchMIRT, która ma lepiej oddawać ich rzeczywiste możliwości.
Redakcja Aigestwczoraj
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
OpenAI zapowiada model Astra, który jako pierwszy LLM osiągnął „krytyczny próg cyberbezpieczeństwa”, potrafiąc samodzielnie znajdować i wykorzystywać luki w systemach komputerowych. Firma planuje jego rychłe udostępnieni
Redakcja Aigestwczoraj

Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność
Google ogłosiło wprowadzenie agentowego rozumienia wideo dla swoich modeli Gemini Flash, co ma zrewolucjonizować analizę treści wideo, znacząco obniżając koszty i zwiększając precyzję.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.