Aigest.
Newsy

Photon-1 od Induction Labs: Model AI symulujący pulpity i fizykę na podstawie surowego wideo

Induction Labs zaprezentowało Photon-1, model AI trenowany na surowym wideo, który potrafi symulować środowiska komputerowe, grać w warcaby i modelować fizykę bilarda, osiągając lepsze wyniki niż konkurencyjne rozwiązani

RA

Udostępnij
Photon-1 od Induction Labs: Model AI symulujący pulpity i fizykę na podstawie surowego wideo
Fot. MarkTechPost

Induction Labs zaprezentowało Photon-1, innowacyjny model sztucznej inteligencji, który uczy się na podstawie surowych nagrań wideo, eliminując potrzebę etykietowania akcji. Firma twierdzi, że to właśnie wymóg etykietowania stanowił dotychczasowe wąskie gardło w rozwoju agentów uczących się z wideo. Photon-1, oparty na architekturze modeli wyobrażeniowych, ma zdolność przewidywania przyszłych stanów i wykonywania zadań, nawet jeśli podczas wstępnego treningu nigdy nie widział konkretnych akcji.

Architektura i trening Photon-1

Photon-1 to rzadki transformator typu mixture-of-experts (MoE) o rozmiarze 106B-A5B, trenowany na materiale odpowiadającym 18 latom nagrań wideo z komputerów. Model ten wykorzystuje niejawną politykę (implicit policy), co oznacza, że uczy się koncepcji działań użytkownika, a nie konkretnych kliknięć myszą. Wstępne szkolenie odbywało się na surowym wideo bez żadnych etykiet akcji, co jest kluczowym wyróżnikiem technologii Induction Labs.

Architektura modelu opiera się na koderze wizyjnym wykorzystującym skończoną skalarną kwantyzację (FSQ). Każda klatka wideo jest kompresowana do 960 dyskretnych tokenów, z których każdy jest 8-wymiarowym wektorem. Każdy wymiar przyjmuje jedną z pięciu wartości: −1, −1/2, 0, 1/2, 1, co daje przestrzeń kodową o rozmiarze 5⁸ możliwych kodów. Otrzymane kodowanie to około 2,2 KB na klatkę, co według Induction Labs, zapewnia ponad 100-krotnie lepszą kompresję niż istniejące reprezentacje OCR i modeli multimodalnych, jednocześnie zachowując tekst, układ i zmiany stanu. Aby osiągnąć taką kompresję, Photon-1 używa różnicowego kodera latentnego, który koduje klatki wideo parami, opisując różnice między nimi, a nie ich zawartość.

Zbiór danych do treningu początkowo zawierał 2 miliardy publicznie dostępnych filmów, zredukowanych do około 2 milionów nagrań ekranów komputerowych. Ostateczny zestaw danych to 575 milionów klatek, próbkowanych z częstotliwością 1 klatki na sekundę, co odpowiada 552 miliardom tokenów lub około 18 latom wideo. Photon-1 był trenowany od podstaw przez jedną epokę, co zajęło około 30 000 godzin GPU H200 i odpowiada 4.4×10²² FLOPs. Zespół badawczy zaimplementował trening w PyTorch, osiągając 40% MFU (model FLOPs utilization).

Wydajność i zastosowania

Na wewnętrznym benchmarku użytkowania komputera, Photon-1 przewyższył Gemini 3.1 Flash-Lite, zużywając znacznie mniej mocy obliczeniowej do wstępnego treningu i kosztując około trzykrotnie mniej w obsłudze. Koszt graniczny Photon-1 na sprzęcie Induction Labs wynosi 0,06 USD za 1 milion tokenów wejściowych i 0,60 USD za 1 milion tokenów wyjściowych.

Model został dostrojony na mniej niż 35 000 trajektoriach użytkowania komputera, aby nauczyć się formatu akcji i instrukcji. Podczas wnioskowania, Photon-1 najpierw przewiduje stan następnej klatki, a następnie generuje akcję, która do niego prowadzi. Następnie stosowane jest uczenie wzmacniające online (online reinforcement learning), gdzie symulacje odbywają się w czasie rzeczywistym na wirtualnych maszynach z systemem Linux (LXQt, Xfce, MATE, GNOME i Plasma), każda z kontem Google i wewnętrznym klonem ChatGPT bez limitów.

Photon-1 został również przetestowany w domenach nieobecnych podczas wstępnego treningu. W 20 000 turniejowych gier w warcaby z Open Checkers Archive 2.0, model pokonał dwie linie bazowe (koder wizyjny i model LLM Ling-flash-2.0) zarówno pod względem symulacji świata, jak i jakości ruchów. W 10 000 syntetycznie wygenerowanych gier bilardowych, symulowanych z prędkością 5 klatek na sekundę, Photon-1 osiągnął średni błąd bezwzględny 0,47 w porównaniu do silnika fizyki, podczas gdy linia bazowa LLM uzyskała 1,15, a koder wizyjny 1,44. Co więcej, Photon-1 nauczył się wykorzystywać klona ChatGPT do tworzenia artefaktów i odpowiadania na pytania, sterując LLM w sposób podobny do ludzkiego.

Znaczenie i perspektywy

Rozwój Photon-1 przez Induction Labs stanowi znaczący krok w kierunku tworzenia bardziej autonomicznych i efektywnych modeli AI. Zdolność uczenia się z surowego wideo bez etykiet akcji może otworzyć nowe możliwości w dziedzinie robotyki, symulacji i interakcji człowiek-komputer. Redukcja kosztów treningu i obsługi, w połączeniu z imponującą wydajnością w różnorodnych zadaniach, wskazuje na potencjał tej technologii do szerokiego zastosowania w przyszłości, szczególnie w scenariuszach wymagających zrozumienia złożonych sekwencji działań i przewidywania ich konsekwencji.

Źródło: marktechpost.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

KwaiKAT Team prezentuje KAT-Coder-V2.5: Model kodujący uczony na ponad 100 000 weryfikowalnych środowiskach
Newsy

KwaiKAT Team prezentuje KAT-Coder-V2.5: Model kodujący uczony na ponad 100 000 weryfikowalnych środowiskach

Zespół KwaiKAT z Kuaishou wprowadził KAT-Coder-V2.5, model kodujący działający w rzeczywistych repozytoriach, oraz jego otwartą wersję KAT-Coder-V2.5-Dev.

Redakcja Aigest1 godz. temu

Niestabilna sieć energetyczna to realne zagrożenie dla rozwoju centrów danych AI
Bibliotekarze uczą, jak wyłączyć sztuczną inteligencję w urządzeniach
Modele OpenAI wymknęły się spod kontroli i autonomicznie zhakowały Hugging Face
Awaria linii energetycznej ujawniła problem centrów danych AI z siecią elektroenergetyczną
Newsy

Awaria linii energetycznej ujawniła problem centrów danych AI z siecią elektroenergetyczną

Niedawna awaria linii energetycznej w pobliżu Waszyngtonu ujawniła rosnący problem stabilności sieci elektroenergetycznej, spowodowany masowym odłączaniem się centrów danych AI. Incydent ten, który doprowadził do skoków

Redakcja Aigest23 godz. temu

Anthropic twierdzi, że Opus 5 niemal całkowicie eliminuje ataki typu prompt injection w swoich produktach

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.