Photon-1 od Induction Labs: Model AI symulujący pulpity i fizykę na podstawie surowego wideo
Induction Labs zaprezentowało Photon-1, model AI trenowany na surowym wideo, który potrafi symulować środowiska komputerowe, grać w warcaby i modelować fizykę bilarda, osiągając lepsze wyniki niż konkurencyjne rozwiązani

Induction Labs zaprezentowało Photon-1, innowacyjny model sztucznej inteligencji, który uczy się na podstawie surowych nagrań wideo, eliminując potrzebę etykietowania akcji. Firma twierdzi, że to właśnie wymóg etykietowania stanowił dotychczasowe wąskie gardło w rozwoju agentów uczących się z wideo. Photon-1, oparty na architekturze modeli wyobrażeniowych, ma zdolność przewidywania przyszłych stanów i wykonywania zadań, nawet jeśli podczas wstępnego treningu nigdy nie widział konkretnych akcji.
Architektura i trening Photon-1
Photon-1 to rzadki transformator typu mixture-of-experts (MoE) o rozmiarze 106B-A5B, trenowany na materiale odpowiadającym 18 latom nagrań wideo z komputerów. Model ten wykorzystuje niejawną politykę (implicit policy), co oznacza, że uczy się koncepcji działań użytkownika, a nie konkretnych kliknięć myszą. Wstępne szkolenie odbywało się na surowym wideo bez żadnych etykiet akcji, co jest kluczowym wyróżnikiem technologii Induction Labs.
Architektura modelu opiera się na koderze wizyjnym wykorzystującym skończoną skalarną kwantyzację (FSQ). Każda klatka wideo jest kompresowana do 960 dyskretnych tokenów, z których każdy jest 8-wymiarowym wektorem. Każdy wymiar przyjmuje jedną z pięciu wartości: −1, −1/2, 0, 1/2, 1, co daje przestrzeń kodową o rozmiarze 5⁸ możliwych kodów. Otrzymane kodowanie to około 2,2 KB na klatkę, co według Induction Labs, zapewnia ponad 100-krotnie lepszą kompresję niż istniejące reprezentacje OCR i modeli multimodalnych, jednocześnie zachowując tekst, układ i zmiany stanu. Aby osiągnąć taką kompresję, Photon-1 używa różnicowego kodera latentnego, który koduje klatki wideo parami, opisując różnice między nimi, a nie ich zawartość.
Zbiór danych do treningu początkowo zawierał 2 miliardy publicznie dostępnych filmów, zredukowanych do około 2 milionów nagrań ekranów komputerowych. Ostateczny zestaw danych to 575 milionów klatek, próbkowanych z częstotliwością 1 klatki na sekundę, co odpowiada 552 miliardom tokenów lub około 18 latom wideo. Photon-1 był trenowany od podstaw przez jedną epokę, co zajęło około 30 000 godzin GPU H200 i odpowiada 4.4×10²² FLOPs. Zespół badawczy zaimplementował trening w PyTorch, osiągając 40% MFU (model FLOPs utilization).
Wydajność i zastosowania
Na wewnętrznym benchmarku użytkowania komputera, Photon-1 przewyższył Gemini 3.1 Flash-Lite, zużywając znacznie mniej mocy obliczeniowej do wstępnego treningu i kosztując około trzykrotnie mniej w obsłudze. Koszt graniczny Photon-1 na sprzęcie Induction Labs wynosi 0,06 USD za 1 milion tokenów wejściowych i 0,60 USD za 1 milion tokenów wyjściowych.
Model został dostrojony na mniej niż 35 000 trajektoriach użytkowania komputera, aby nauczyć się formatu akcji i instrukcji. Podczas wnioskowania, Photon-1 najpierw przewiduje stan następnej klatki, a następnie generuje akcję, która do niego prowadzi. Następnie stosowane jest uczenie wzmacniające online (online reinforcement learning), gdzie symulacje odbywają się w czasie rzeczywistym na wirtualnych maszynach z systemem Linux (LXQt, Xfce, MATE, GNOME i Plasma), każda z kontem Google i wewnętrznym klonem ChatGPT bez limitów.
Photon-1 został również przetestowany w domenach nieobecnych podczas wstępnego treningu. W 20 000 turniejowych gier w warcaby z Open Checkers Archive 2.0, model pokonał dwie linie bazowe (koder wizyjny i model LLM Ling-flash-2.0) zarówno pod względem symulacji świata, jak i jakości ruchów. W 10 000 syntetycznie wygenerowanych gier bilardowych, symulowanych z prędkością 5 klatek na sekundę, Photon-1 osiągnął średni błąd bezwzględny 0,47 w porównaniu do silnika fizyki, podczas gdy linia bazowa LLM uzyskała 1,15, a koder wizyjny 1,44. Co więcej, Photon-1 nauczył się wykorzystywać klona ChatGPT do tworzenia artefaktów i odpowiadania na pytania, sterując LLM w sposób podobny do ludzkiego.
Znaczenie i perspektywy
Rozwój Photon-1 przez Induction Labs stanowi znaczący krok w kierunku tworzenia bardziej autonomicznych i efektywnych modeli AI. Zdolność uczenia się z surowego wideo bez etykiet akcji może otworzyć nowe możliwości w dziedzinie robotyki, symulacji i interakcji człowiek-komputer. Redukcja kosztów treningu i obsługi, w połączeniu z imponującą wydajnością w różnorodnych zadaniach, wskazuje na potencjał tej technologii do szerokiego zastosowania w przyszłości, szczególnie w scenariuszach wymagających zrozumienia złożonych sekwencji działań i przewidywania ich konsekwencji.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Pozew przeciwko OpenAI: ChatGPT miał pogłębić urojenia religijne użytkownika
Mężczyzna z zaburzeniem dwubiegunowym pozywa OpenAI, twierdząc, że ChatGPT pogłębił jego urojenia religijne, doprowadzając go do próby samobójczej. Bot miał utwierdzać go w przekonaniu, że jest Jezusem, a następnie, że s
Redakcja Aigest7 godz. temu

Wycena Mistral AI na 21 miliardów euro to sygnał do ostrożności, nie euforii
Wycena Mistral AI na ponad 21 miliardów euro, osiągnięta w największej rundzie finansowania w Europie, budzi pytania o realną wartość i przyszłość rynku AI.
Michał Chmielarz10 godz. temu
Meta prezentuje Muse: osobistego agenta AI działającego w dedykowanej chmurze
Meta wprowadziła Muse, osobistego agenta AI, który wykonuje zadania, a nie tylko odpowiada na pytania. Działa on w dedykowanej, bezpiecznej chmurze.
Redakcja Aigest14 godz. temu

Kontrowersje wokół OpenAI i problemu istnienia i gładkości Navier-Stokesa: Przyszłość matematyki w erze AI
OpenAI ogłosiło rozwiązanie jednego z Problemów Milenijnych, lecz sukces ten przyćmiły oskarżenia o brak atrybucji i wykorzystanie pracy innych badaczy. Incydent ten rodzi pytania o rolę ludzkich matematyków w obliczu po
Redakcja Aigest15 godz. temu

Microsoft łata rekordową liczbę luk bezpieczeństwa, w tle debata o AI w cyberbezpieczeństwie
Microsoft opublikował rekordową aktualizację bezpieczeństwa, naprawiając blisko tysiąc luk, w tym ponad sto krytycznych. Działania te wpisują się w szerszy trend branżowy, napędzany obawami przed atakami wspomaganymi prz
Redakcja Aigest21 godz. temu

OpenAI pod presją: zarzuty o naciski na matematyka w sprawie przełomu w równaniach Naviera-Stokesa
Matematyk Tristan Buckmaster oskarża OpenAI o próby usunięcia współautora z publikacji dotyczącej przełomu w równaniach Naviera-Stokesa, co miało być spowodowane jego związkiem z firmą Anthropic.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.