Aigest.
Newsy

MirroS prezentuje Code-as-World: Nowe podejście do reprezentacji świata fizycznego w AI

MirroS wprowadza Code-as-World, paradygmat reprezentujący światy fizyczne jako wykonywalne programy, co pozwala modelom AI na zrozumienie mechanizmów sceny, a nie tylko jej wizualnych aspektów.

RA

Udostępnij
MirroS prezentuje Code-as-World: Nowe podejście do reprezentacji świata fizycznego w AI
Fot. MarkTechPost

Firma MirroS zaprezentowała Code-as-World, innowacyjne podejście, które ma na celu rewolucjonizację sposobu, w jaki sztuczna inteligencja rozumie i przetwarza świat fizyczny. Zamiast opierać się na pikselach, latentnych reprezentacjach czy podpisach, Code-as-World przedstawia scenę jako wykonywalny kod – plik scene.json, który może być uruchamiany w środowisku MuJoCo. Dzięki temu agenci AI mogą weryfikować scenę na podstawie oryginalnego wideo, a użytkownicy mogą ją edytować i ponownie symulować.

Wykonywalne Reprezentacje Świata (EWR)

Kluczową ideą Code-as-World jest argument, że piksele są jedynie dowodem na istnienie sceny fizycznej, a nie jej ontologią. Modele wideo mogą przewidywać realistyczne klatki, nie rozumiejąc przy tym podstawowych praw fizyki, takich jak masa, kontakt czy grawitacja. MirroS twierdzi, że tradycyjne modele wideo, rekonstrukcje 3D i podpisy tekstowe odzyskują jedynie częściowe aspekty sceny, ale żadne z nich nie jest w stanie uchwycić jej mechanizmu. Code-as-World rozwiązuje ten problem, reprezentując scenę jako wykonywalną reprezentację świata (EWR), czyli trójkę p = (C, E, A), która w zaimplementowanej wersji kompiluje się do pliku scene.json. Ten plik jest następnie wykonywany w MuJoCo, wykorzystując zamiennie silnik animacji (pozowanie kinematyczne) lub silnik fizyki (siły i kontakty).

Agentowa pętla i proces odzyskiwania

Odzyskiwanie EWR z nagrania wideo to problem odwrotny, który zespół MirroS ujął jako abdukcyjne wyszukiwanie. Agent wykonuje pętlę składającą się z pięciu etapów: proponowanie → instancjonowanie → wykonywanie → renderowanie → weryfikowanie, powtarzając ją do pięciu razy (K=5). W przypadku danych wejściowych wideo, system wykorzystuje SAM 3 do dostarczania masek instancji i ścieżek na płaszczyźnie obrazu, VGGT-Omega do szacowania głębi i geometrii kamery, a SAM 3D do generowania siatek dla poszczególnych obiektów. Kandydackie symulacje są następnie rzutowane z powrotem do widoku wejściowego i porównywane w wybranych klatkach kluczowych pod kątem RGB, głębi, masek i trajektorii. Rozbieżności na poziomie klatek są agregowane w ustrukturyzowaną informację zwrotną (Δ), która kieruje kolejną rewizją. Jeśli budżet iteracji zostanie wyczerpany bez akceptacji, hipoteza jest odrzucana.

Wydajność i dostępność

Code-as-World-VL-9B osiągnął wynik 55.4 MRA w walidacji QuantiPhy, przewyższając Gemini-3.1 Flash (54.8) i będąc o około 15 punktów wyżej niż najsilniejszy otwarty model bazowy. Warto zauważyć, że modele Code-as-World-VL-4B i Code-as-World-VL-9B zostały wytrenowane odpowiednio na Qwen3.5-4B i Qwen3.5-9B. MirroS udostępniło repozytorium GitHub oraz dwa punkty kontrolne (Code-as-World-VL-4B i Code-as-World-VL-9B) na licencji Apache 2.0. Oba modele są dostarczane jako BF16 safetensors za pośrednictwem vLLM, z kompatybilnym z OpenAI endpointem /v1, obsługującym 16 próbkowanych klatek na wideo i --max-model-len 4608. Trening odbywał się na ośmiu procesorach NVIDIA H100.

Faza 1 obejmowała nadzorowane dostrajanie na 73 335 parach pytań i odpowiedzi w przestrzeni obrazu, obejmujących zakres, pozycję, przemieszczenie, prędkość i przyspieszenie. Faza 2 zastosowała GRPO do VQA w przestrzeni świata, czerpiąc z 1 585 światów wykonywalnych sterowanych tekstem i 988 sterowanych wideo, z nagrodą za skalowalną dokładność numeryczną. Wyniki ablacjacyjne pokazują, że dodanie źródeł z przestrzeni świata znacząco poprawia wyniki, podnosząc je z 44.2 (4B) i 50.9 (9B) do odpowiednio 50.6 i 55.4.

Rozwój Code-as-World stanowi znaczący krok w kierunku tworzenia systemów AI, które nie tylko widzą, ale i rozumieją fizyczne interakcje w świecie. Możliwość generowania wykonywalnych reprezentacji scen z rzeczywistych nagrań wideo otwiera nowe perspektywy dla robotyki, symulacji i rozwoju bardziej inteligentnych agentów, którzy potrafią przewidywać i reagować na złożone zjawiska fizyczne z większą precyzją. To podejście może również dostarczyć cenne dane treningowe z dokładnymi etykietami fizycznymi, których brakuje w tradycyjnych danych wideo.

Źródło: marktechpost.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
Amazon wykorzystuje AI do walki z oszustwami, Alexa pomoże rozpoznać scamy
IBM i Confluent łączą siły: modele szeregów czasowych dla inteligencji w czasie rzeczywistym
Meta Superintelligence Labs wprowadza Muse Voice Transcribe – jeden model dla transkrypcji, diaryzacji i detekcji końca
Runway prezentuje Solaris: AI generujące interfejsy w czasie rzeczywistym
Keenable AI udostępnia NEEDLE: dynamiczny benchmark wyszukiwarek z godzinową aktualizacją zapytań

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.