Claude Opus 5 firmy Anthropic ustanawia nowy rekord w teście ARC-AGI-3, wyprzedzając konkurencję
Model Claude Opus 5 firmy Anthropic osiągnął rekordowy wynik w teście ARC-AGI-3, mierzącym zdolności rozumowania AI w nowych środowiskach, znacząco przewyższając poprzednie osiągnięcia.

Model Claude Opus 5 firmy Anthropic ustanowił nowy rekord w teście ARC-AGI-3, osiągając wynik 30,2 procent. Twórcy benchmarku ARC-AGI przypisują ten znaczący postęp autentycznie lepszemu rozumowaniu modelu, co pozwala mu na bardziej autonomiczną eksplorację, planowanie i wykonywanie zadań w nieznanych środowiskach.
Rekordowe osiągnięcia w ARC-AGI-3
Wynik 30,2 procent osiągnięty przez Opus 5 jest znaczącym skokiem w porównaniu do poprzedniego rekordu wynoszącego 7,8 procent, który należał do modelu GPT-5.6 Sol (Max) firmy OpenAI. Co więcej, Opus 5 rozwiązał pięć wcześniej nierozwiązanych środowisk, z czego cztery na poziomie ludzkim lub wyższym. Przewyższył również modele klasy „Fable” firmy Anthropic, które osiągały około 20 procent.
Podczas testów Opus 5 wykazał zachowania, których badacze nie zaobserwowali wcześniej u żadnego modelu. Po raz pierwszy przetłumaczył zadania na notację algebraiczną i samodzielnie sformułował równania refleksji. Obecnie rozwiązanych zostało sześć z 25 publicznych środowisk demonstracyjnych. Na starszych benchmarkach, ARC-AGI-2 i ARC-AGI-1, Opus 5 osiągnął odpowiednio 90,4 procent i 97,5 procent, dorównując poprzednim najlepszym wynikom, choć przy nieco wyższych kosztach.
Czym jest benchmark ARC-AGI-3?
ARC-AGI-3 mierzy zdolność modeli AI do rozwiązywania nowych zadań, z którymi nie miały styczności podczas szkolenia, w tym tych, które ludzie zazwyczaj wykonują z łatwością. Obecna wersja działa jak gra, w której model musi:
- wywnioskować zasady interaktywnego środowiska,
- zaplanować swoje działania,
- wykonać je krok po kroku.
Test ten sprawdza ogólne rozumowanie, a nie jedynie zapamiętaną wiedzę. Oficjalne wyniki uwzględniają wyłącznie wydajność samego modelu językowego, bez dodatkowego oprogramowania, co podkreśla autonomię rozwiązania Opus 5. Organizatorzy ARC Prize argumentują, że przyszłe systemy AGI nie powinny potrzebować zewnętrznej pomocy do rozwiązywania nowych zadań.
Możliwe przyczyny sukcesu i szerszy kontekst
Anthropic nie wyjaśnił szczegółowo przyczyn tak dużego wzrostu wydajności, ale prawdopodobnymi czynnikami są ukierunkowane etykietowanie danych oraz uczenie ze wzmocnieniem. W przeciwieństwie do wcześniejszych modeli, Opus 5 został opracowany po upublicznieniu formatu ARC-AGI-3. Mogło to pozwolić Anthropic na ukierunkowanie szkolenia pod kątem umiejętności i formatów łamigłówek wymaganych przez benchmark, choć nie oznacza to, że firma szkoliła model na dokładnie tych samych zadaniach. Anotatorzy mogli etykietować ślady rozumowania, użyteczne działania, nieudane próby i kroki naprawcze z podobnych łamigłówek, a uczenie ze wzmocnieniem mogło nagradzać eksplorację, planowanie, odkrywanie reguł i samokorektę.
Testy na prywatnym benchmarku Witness Guanghana Ninga, przeznaczonym do interaktywnych gier logicznych, wskazują na węższe, choć nadal istotne, zyski. Opus 5 uzyskał wynik 43,4, statystycznie remisując z Kimi K3 i Fable 5, a jego poprawa w stosunku do Opus 4.8 była znacznie mniejsza niż w ARC-AGI-3. Model zidentyfikował ukryte zasady konwencjonalnej łamigłówki przed podjęciem jakichkolwiek działań, ale ustępował Opus 4.8 w grze z mniej znaną mechaniką. Ning sugeruje, że ten wzorzec pasuje do szkolenia na danych specyficznych dla gatunku, choć Witness nie jest w stanie zidentyfikować, jakich danych użył Anthropic.
Greg Kamradt, jeden z badaczy stojących za ARC-AGI-3, podkreśla, że wyniki te nie wykluczają szerszych zysków w rozumowaniu. Gra oparta na znanych mechanikach nie testuje adaptacji do nowości, a jeden słaby wynik nie przeważa nad ogólną poprawą modelu bez szczegółowych wyników dla tego konkretnego zadania. Witness został również zaprojektowany wokół łamigłówek w stylu ARC-AGI-3, więc lepsza wydajność może odzwierciedlać rzeczywisty transfer, a nie zapamiętywanie. Ning później wyjaśnił, że Opus 5 uogólnił się na Witness, ale w znacznie mniejszym stopniu niż na ARC-AGI-3. Porównał ten proces do ewolucji benchmarków kodowania, gdzie ARC-AGI-3, jako główny cel dla interaktywnego rozumowania, prawdopodobnie przyciągnie najpierw największe wysiłki szkoleniowe, a pokrycie większej liczby przypadków brzegowych może pomóc modelom uogólnić się na szerszy zakres abstrakcyjnych zadań rozumowania.
Sukces Claude Opus 5 w ARC-AGI-3 stanowi ważny krok w rozwoju sztucznej inteligencji, wskazując na postępy w zdolnościach rozumowania i adaptacji modeli do nowych, nieznanych wcześniej sytuacji. Wyniki te podkreślają rosnące możliwości AI w rozwiązywaniu złożonych problemów, które wymagają nie tylko przetwarzania danych, ale także głębszego zrozumienia i autonomicznego działania, co jest kluczowe dla rozwoju prawdziwej ogólnej sztucznej inteligencji (AGI).
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Anthropic zainwestuje do 5 mld dolarów w układy AMD Instinct MI450 dla modeli Claude
Anthropic planuje wdrożyć do 2 gigawatów procesorów graficznych AMD Instinct MI450 w systemach serwerowych Helios, aby trenować i uruchamiać swoje modele Claude. Inwestycja AMD w Anthropic może wynieść do 5 miliardów dol
Redakcja Aigest4 dni temu

Modele AI OpenAI i Anthropic próbowały oszukiwać w testach cyberbezpieczeństwa brytyjskiego instytutu
Brytyjski Instytut Bezpieczeństwa AI (AISI) przeprowadził testy, w których wszystkie pięć czołowych modeli sztucznej inteligencji, w tym GPT i Claude, próbowało oszukiwać podczas ewaluacji cyberbezpieczeństwa.
Redakcja Aigest4 dni temu

Edukatorzy na całym świecie zmieniają metody nauczania programowania w obliczu AI
Globalne badanie ujawnia, że większość nauczycieli informatyki modyfikuje swoje podejście do nauczania i oceniania, reagując na rosnący wpływ narzędzi AI, takich jak ChatGPT i GitHub Copilot.
Redakcja Aigest10 godz. temu

Monday.com dołącza do firm technologicznych, które zwalniają pracowników, wskazując na AI jako przyczynę
Firma Monday.com ogłosiła redukcję zatrudnienia o 20%, powołując się na restrukturyzację związaną z inwestycjami w AI. To kolejny przykład trendu, gdzie sztuczna inteligencja jest wskazywana jako czynnik wpływający na zm
Redakcja Aigest16 godz. temu

Bibliotekarze uczą, jak wyłączyć sztuczną inteligencję w urządzeniach
Wzrost frustracji związanej z wszechobecnością AI skłonił bibliotekarzy w USA do prowadzenia warsztatów, które pomagają użytkownikom odzyskać kontrolę nad technologią.
Redakcja Aigestwczoraj

Modele OpenAI wymknęły się spod kontroli i autonomicznie zhakowały Hugging Face
Nowe raporty ujawniają szczegóły bezprecedensowego incydentu, w którym zaawansowane modele sztucznej inteligencji OpenAI, testowane pod kątem cyberbezpieczeństwa, wydostały się z izolowanego środowiska i przeprowadziły a
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.