MirroS prezentuje Code-as-World: Nowe podejście do reprezentacji świata fizycznego w AI
MirroS wprowadza Code-as-World, paradygmat reprezentujący światy fizyczne jako wykonywalne programy, co pozwala modelom AI na zrozumienie mechanizmów sceny, a nie tylko jej wizualnych aspektów.

Firma MirroS zaprezentowała Code-as-World, innowacyjne podejście, które ma na celu rewolucjonizację sposobu, w jaki sztuczna inteligencja rozumie i przetwarza świat fizyczny. Zamiast opierać się na pikselach, latentnych reprezentacjach czy podpisach, Code-as-World przedstawia scenę jako wykonywalny kod – plik scene.json, który może być uruchamiany w środowisku MuJoCo. Dzięki temu agenci AI mogą weryfikować scenę na podstawie oryginalnego wideo, a użytkownicy mogą ją edytować i ponownie symulować.
Wykonywalne Reprezentacje Świata (EWR)
Kluczową ideą Code-as-World jest argument, że piksele są jedynie dowodem na istnienie sceny fizycznej, a nie jej ontologią. Modele wideo mogą przewidywać realistyczne klatki, nie rozumiejąc przy tym podstawowych praw fizyki, takich jak masa, kontakt czy grawitacja. MirroS twierdzi, że tradycyjne modele wideo, rekonstrukcje 3D i podpisy tekstowe odzyskują jedynie częściowe aspekty sceny, ale żadne z nich nie jest w stanie uchwycić jej mechanizmu. Code-as-World rozwiązuje ten problem, reprezentując scenę jako wykonywalną reprezentację świata (EWR), czyli trójkę p = (C, E, A), która w zaimplementowanej wersji kompiluje się do pliku scene.json. Ten plik jest następnie wykonywany w MuJoCo, wykorzystując zamiennie silnik animacji (pozowanie kinematyczne) lub silnik fizyki (siły i kontakty).
Agentowa pętla i proces odzyskiwania
Odzyskiwanie EWR z nagrania wideo to problem odwrotny, który zespół MirroS ujął jako abdukcyjne wyszukiwanie. Agent wykonuje pętlę składającą się z pięciu etapów: proponowanie → instancjonowanie → wykonywanie → renderowanie → weryfikowanie, powtarzając ją do pięciu razy (K=5). W przypadku danych wejściowych wideo, system wykorzystuje SAM 3 do dostarczania masek instancji i ścieżek na płaszczyźnie obrazu, VGGT-Omega do szacowania głębi i geometrii kamery, a SAM 3D do generowania siatek dla poszczególnych obiektów. Kandydackie symulacje są następnie rzutowane z powrotem do widoku wejściowego i porównywane w wybranych klatkach kluczowych pod kątem RGB, głębi, masek i trajektorii. Rozbieżności na poziomie klatek są agregowane w ustrukturyzowaną informację zwrotną (Δ), która kieruje kolejną rewizją. Jeśli budżet iteracji zostanie wyczerpany bez akceptacji, hipoteza jest odrzucana.
Wydajność i dostępność
Code-as-World-VL-9B osiągnął wynik 55.4 MRA w walidacji QuantiPhy, przewyższając Gemini-3.1 Flash (54.8) i będąc o około 15 punktów wyżej niż najsilniejszy otwarty model bazowy. Warto zauważyć, że modele Code-as-World-VL-4B i Code-as-World-VL-9B zostały wytrenowane odpowiednio na Qwen3.5-4B i Qwen3.5-9B. MirroS udostępniło repozytorium GitHub oraz dwa punkty kontrolne (Code-as-World-VL-4B i Code-as-World-VL-9B) na licencji Apache 2.0. Oba modele są dostarczane jako BF16 safetensors za pośrednictwem vLLM, z kompatybilnym z OpenAI endpointem /v1, obsługującym 16 próbkowanych klatek na wideo i --max-model-len 4608. Trening odbywał się na ośmiu procesorach NVIDIA H100.
Faza 1 obejmowała nadzorowane dostrajanie na 73 335 parach pytań i odpowiedzi w przestrzeni obrazu, obejmujących zakres, pozycję, przemieszczenie, prędkość i przyspieszenie. Faza 2 zastosowała GRPO do VQA w przestrzeni świata, czerpiąc z 1 585 światów wykonywalnych sterowanych tekstem i 988 sterowanych wideo, z nagrodą za skalowalną dokładność numeryczną. Wyniki ablacjacyjne pokazują, że dodanie źródeł z przestrzeni świata znacząco poprawia wyniki, podnosząc je z 44.2 (4B) i 50.9 (9B) do odpowiednio 50.6 i 55.4.
Rozwój Code-as-World stanowi znaczący krok w kierunku tworzenia systemów AI, które nie tylko widzą, ale i rozumieją fizyczne interakcje w świecie. Możliwość generowania wykonywalnych reprezentacji scen z rzeczywistych nagrań wideo otwiera nowe perspektywy dla robotyki, symulacji i rozwoju bardziej inteligentnych agentów, którzy potrafią przewidywać i reagować na złożone zjawiska fizyczne z większą precyzją. To podejście może również dostarczyć cenne dane treningowe z dokładnymi etykietami fizycznymi, których brakuje w tradycyjnych danych wideo.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
Max Spero, CEO firmy Pangram, ostrzega przed rosnącym problemem zaufania w internecie, wynikającym z powszechnego użycia treści generowanych przez sztuczną inteligencję. Jego firma oferuje narzędzia do wykrywania AI, aby
Redakcja Aigest9 godz. temu

Amazon wykorzystuje AI do walki z oszustwami, Alexa pomoże rozpoznać scamy
Amazon wprowadza nowe funkcje oparte na sztucznej inteligencji, aby pomóc klientom w identyfikacji fałszywych wiadomości i oszustw. Usługa Alexa for Shopping będzie teraz w stanie potwierdzić autentyczność komunikacji od
Redakcja Aigest11 godz. temu

IBM i Confluent łączą siły: modele szeregów czasowych dla inteligencji w czasie rzeczywistym
IBM i Confluent wprowadzają modele fundamentowe szeregów czasowych (TSFM) do przetwarzania danych strumieniowych, umożliwiając podejmowanie decyzji w czasie rzeczywistym w różnych branżach. Rozwiązanie jest dostępne w Co
Redakcja Aigest12 godz. temu
Meta Superintelligence Labs wprowadza Muse Voice Transcribe – jeden model dla transkrypcji, diaryzacji i detekcji końca
Meta Superintelligence Labs zaprezentowało Muse Voice Transcribe, innowacyjny model AI, który łączy funkcje transkrypcji mowy, rozdzielania mówców i detekcji końca wypowiedzi w jednym systemie, znacząco redukując opóźnie
Redakcja Aigest20 godz. temu

Runway prezentuje Solaris: AI generujące interfejsy w czasie rzeczywistym
Firma Runway wprowadza Solaris, nowy model AI, który generuje interfejsy użytkownika w czasie rzeczywistym, reagując na interakcje. Ma to zrewolucjonizować sposób, w jaki postrzegamy i używamy oprogramowania.
Redakcja Aigestwczoraj

Keenable AI udostępnia NEEDLE: dynamiczny benchmark wyszukiwarek z godzinową aktualizacją zapytań
Firma Keenable AI zaprezentowała NEEDLE, innowacyjny benchmark open-source, który na bieżąco generuje zestawy zapytań, aby precyzyjnie oceniać wydajność API wyszukiwarek w kontekście dynamicznych danych.
Redakcja Aigest2 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.