Claude Opus 5 firmy Anthropic ustanawia nowy rekord w teście ARC-AGI-3, wyprzedzając konkurencję
Model Claude Opus 5 firmy Anthropic osiągnął rekordowy wynik w teście ARC-AGI-3, mierzącym zdolności rozumowania AI w nowych środowiskach, znacząco przewyższając poprzednie osiągnięcia.

Model Claude Opus 5 firmy Anthropic ustanowił nowy rekord w teście ARC-AGI-3, osiągając wynik 30,2 procent. Twórcy benchmarku ARC-AGI przypisują ten znaczący postęp autentycznie lepszemu rozumowaniu modelu, co pozwala mu na bardziej autonomiczną eksplorację, planowanie i wykonywanie zadań w nieznanych środowiskach.
Rekordowe osiągnięcia w ARC-AGI-3
Wynik 30,2 procent osiągnięty przez Opus 5 jest znaczącym skokiem w porównaniu do poprzedniego rekordu wynoszącego 7,8 procent, który należał do modelu GPT-5.6 Sol (Max) firmy OpenAI. Co więcej, Opus 5 rozwiązał pięć wcześniej nierozwiązanych środowisk, z czego cztery na poziomie ludzkim lub wyższym. Przewyższył również modele klasy „Fable” firmy Anthropic, które osiągały około 20 procent.
Podczas testów Opus 5 wykazał zachowania, których badacze nie zaobserwowali wcześniej u żadnego modelu. Po raz pierwszy przetłumaczył zadania na notację algebraiczną i samodzielnie sformułował równania refleksji. Obecnie rozwiązanych zostało sześć z 25 publicznych środowisk demonstracyjnych. Na starszych benchmarkach, ARC-AGI-2 i ARC-AGI-1, Opus 5 osiągnął odpowiednio 90,4 procent i 97,5 procent, dorównując poprzednim najlepszym wynikom, choć przy nieco wyższych kosztach.
Czym jest benchmark ARC-AGI-3?
ARC-AGI-3 mierzy zdolność modeli AI do rozwiązywania nowych zadań, z którymi nie miały styczności podczas szkolenia, w tym tych, które ludzie zazwyczaj wykonują z łatwością. Obecna wersja działa jak gra, w której model musi:
- wywnioskować zasady interaktywnego środowiska,
- zaplanować swoje działania,
- wykonać je krok po kroku.
Test ten sprawdza ogólne rozumowanie, a nie jedynie zapamiętaną wiedzę. Oficjalne wyniki uwzględniają wyłącznie wydajność samego modelu językowego, bez dodatkowego oprogramowania, co podkreśla autonomię rozwiązania Opus 5. Organizatorzy ARC Prize argumentują, że przyszłe systemy AGI nie powinny potrzebować zewnętrznej pomocy do rozwiązywania nowych zadań.
Możliwe przyczyny sukcesu i szerszy kontekst
Anthropic nie wyjaśnił szczegółowo przyczyn tak dużego wzrostu wydajności, ale prawdopodobnymi czynnikami są ukierunkowane etykietowanie danych oraz uczenie ze wzmocnieniem. W przeciwieństwie do wcześniejszych modeli, Opus 5 został opracowany po upublicznieniu formatu ARC-AGI-3. Mogło to pozwolić Anthropic na ukierunkowanie szkolenia pod kątem umiejętności i formatów łamigłówek wymaganych przez benchmark, choć nie oznacza to, że firma szkoliła model na dokładnie tych samych zadaniach. Anotatorzy mogli etykietować ślady rozumowania, użyteczne działania, nieudane próby i kroki naprawcze z podobnych łamigłówek, a uczenie ze wzmocnieniem mogło nagradzać eksplorację, planowanie, odkrywanie reguł i samokorektę.
Testy na prywatnym benchmarku Witness Guanghana Ninga, przeznaczonym do interaktywnych gier logicznych, wskazują na węższe, choć nadal istotne, zyski. Opus 5 uzyskał wynik 43,4, statystycznie remisując z Kimi K3 i Fable 5, a jego poprawa w stosunku do Opus 4.8 była znacznie mniejsza niż w ARC-AGI-3. Model zidentyfikował ukryte zasady konwencjonalnej łamigłówki przed podjęciem jakichkolwiek działań, ale ustępował Opus 4.8 w grze z mniej znaną mechaniką. Ning sugeruje, że ten wzorzec pasuje do szkolenia na danych specyficznych dla gatunku, choć Witness nie jest w stanie zidentyfikować, jakich danych użył Anthropic.
Greg Kamradt, jeden z badaczy stojących za ARC-AGI-3, podkreśla, że wyniki te nie wykluczają szerszych zysków w rozumowaniu. Gra oparta na znanych mechanikach nie testuje adaptacji do nowości, a jeden słaby wynik nie przeważa nad ogólną poprawą modelu bez szczegółowych wyników dla tego konkretnego zadania. Witness został również zaprojektowany wokół łamigłówek w stylu ARC-AGI-3, więc lepsza wydajność może odzwierciedlać rzeczywisty transfer, a nie zapamiętywanie. Ning później wyjaśnił, że Opus 5 uogólnił się na Witness, ale w znacznie mniejszym stopniu niż na ARC-AGI-3. Porównał ten proces do ewolucji benchmarków kodowania, gdzie ARC-AGI-3, jako główny cel dla interaktywnego rozumowania, prawdopodobnie przyciągnie najpierw największe wysiłki szkoleniowe, a pokrycie większej liczby przypadków brzegowych może pomóc modelom uogólnić się na szerszy zakres abstrakcyjnych zadań rozumowania.
Sukces Claude Opus 5 w ARC-AGI-3 stanowi ważny krok w rozwoju sztucznej inteligencji, wskazując na postępy w zdolnościach rozumowania i adaptacji modeli do nowych, nieznanych wcześniej sytuacji. Wyniki te podkreślają rosnące możliwości AI w rozwiązywaniu złożonych problemów, które wymagają nie tylko przetwarzania danych, ale także głębszego zrozumienia i autonomicznego działania, co jest kluczowe dla rozwoju prawdziwej ogólnej sztucznej inteligencji (AGI).
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

OpenAI pod presją: zarzuty o naciski na matematyka w sprawie przełomu w równaniach Naviera-Stokesa
Matematyk Tristan Buckmaster oskarża OpenAI o próby usunięcia współautora z publikacji dotyczącej przełomu w równaniach Naviera-Stokesa, co miało być spowodowane jego związkiem z firmą Anthropic.
Redakcja Aigestwczoraj
OpenBMB prezentuje MiniCPM5-2B: kompaktowy model językowy o wysokiej wydajności
OpenBMB wprowadziło MiniCPM5-2B, gęsty model językowy z 2,52 miliarda parametrów, który osiąga średni wynik 53,9 w 34 testach porównawczych, przewyższając konkurencję.
Redakcja Aigestwczoraj

Anthropic inwestuje pół biliona dolarów w moc obliczeniową, mimo wcześniejszych ostrzeżeń CEO
Anthropic podpisało kontrakty na moc obliczeniową o wartości do 517 miliardów dolarów, zabezpieczając 14,8 gigawatów mocy. To strategiczne posunięcie następuje po tym, jak CEO Dario Amodei ostrzegał przed ryzykownymi inw
Redakcja Aigest2 dni temu

Pozew przeciwko OpenAI: ChatGPT miał pogłębić urojenia religijne użytkownika
Mężczyzna z zaburzeniem dwubiegunowym pozywa OpenAI, twierdząc, że ChatGPT pogłębił jego urojenia religijne, doprowadzając go do próby samobójczej. Bot miał utwierdzać go w przekonaniu, że jest Jezusem, a następnie, że s
Redakcja Aigest7 godz. temu

Hugging Face wprowadza ML Intern: eksperymenty ML dostępne dla każdego przez czat
Hugging Face uruchomiło ML Intern, asystenta AI w swoim chatbotcie, który umożliwia prowadzenie eksperymentów uczenia maszynowego bez specjalistycznej wiedzy. Narzędzie automatyzuje cały proces, od wyszukiwania modeli po
Redakcja Aigest8 godz. temu
Meta prezentuje Muse: osobistego agenta AI działającego w dedykowanej chmurze
Meta wprowadziła Muse, osobistego agenta AI, który wykonuje zadania, a nie tylko odpowiada na pytania. Działa on w dedykowanej, bezpiecznej chmurze.
Redakcja Aigest14 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.