Aigest.
Newsy

Claude Opus 5 firmy Anthropic ustanawia nowy rekord w teście ARC-AGI-3, wyprzedzając konkurencję

Model Claude Opus 5 firmy Anthropic osiągnął rekordowy wynik w teście ARC-AGI-3, mierzącym zdolności rozumowania AI w nowych środowiskach, znacząco przewyższając poprzednie osiągnięcia.

RA

Udostępnij
Claude Opus 5 firmy Anthropic ustanawia nowy rekord w teście ARC-AGI-3, wyprzedzając konkurencję
Fot. The Decoder

Model Claude Opus 5 firmy Anthropic ustanowił nowy rekord w teście ARC-AGI-3, osiągając wynik 30,2 procent. Twórcy benchmarku ARC-AGI przypisują ten znaczący postęp autentycznie lepszemu rozumowaniu modelu, co pozwala mu na bardziej autonomiczną eksplorację, planowanie i wykonywanie zadań w nieznanych środowiskach.

Rekordowe osiągnięcia w ARC-AGI-3

Wynik 30,2 procent osiągnięty przez Opus 5 jest znaczącym skokiem w porównaniu do poprzedniego rekordu wynoszącego 7,8 procent, który należał do modelu GPT-5.6 Sol (Max) firmy OpenAI. Co więcej, Opus 5 rozwiązał pięć wcześniej nierozwiązanych środowisk, z czego cztery na poziomie ludzkim lub wyższym. Przewyższył również modele klasy „Fable” firmy Anthropic, które osiągały około 20 procent.

Podczas testów Opus 5 wykazał zachowania, których badacze nie zaobserwowali wcześniej u żadnego modelu. Po raz pierwszy przetłumaczył zadania na notację algebraiczną i samodzielnie sformułował równania refleksji. Obecnie rozwiązanych zostało sześć z 25 publicznych środowisk demonstracyjnych. Na starszych benchmarkach, ARC-AGI-2 i ARC-AGI-1, Opus 5 osiągnął odpowiednio 90,4 procent i 97,5 procent, dorównując poprzednim najlepszym wynikom, choć przy nieco wyższych kosztach.

Czym jest benchmark ARC-AGI-3?

ARC-AGI-3 mierzy zdolność modeli AI do rozwiązywania nowych zadań, z którymi nie miały styczności podczas szkolenia, w tym tych, które ludzie zazwyczaj wykonują z łatwością. Obecna wersja działa jak gra, w której model musi:

  • wywnioskować zasady interaktywnego środowiska,
  • zaplanować swoje działania,
  • wykonać je krok po kroku.

Test ten sprawdza ogólne rozumowanie, a nie jedynie zapamiętaną wiedzę. Oficjalne wyniki uwzględniają wyłącznie wydajność samego modelu językowego, bez dodatkowego oprogramowania, co podkreśla autonomię rozwiązania Opus 5. Organizatorzy ARC Prize argumentują, że przyszłe systemy AGI nie powinny potrzebować zewnętrznej pomocy do rozwiązywania nowych zadań.

Możliwe przyczyny sukcesu i szerszy kontekst

Anthropic nie wyjaśnił szczegółowo przyczyn tak dużego wzrostu wydajności, ale prawdopodobnymi czynnikami są ukierunkowane etykietowanie danych oraz uczenie ze wzmocnieniem. W przeciwieństwie do wcześniejszych modeli, Opus 5 został opracowany po upublicznieniu formatu ARC-AGI-3. Mogło to pozwolić Anthropic na ukierunkowanie szkolenia pod kątem umiejętności i formatów łamigłówek wymaganych przez benchmark, choć nie oznacza to, że firma szkoliła model na dokładnie tych samych zadaniach. Anotatorzy mogli etykietować ślady rozumowania, użyteczne działania, nieudane próby i kroki naprawcze z podobnych łamigłówek, a uczenie ze wzmocnieniem mogło nagradzać eksplorację, planowanie, odkrywanie reguł i samokorektę.

Testy na prywatnym benchmarku Witness Guanghana Ninga, przeznaczonym do interaktywnych gier logicznych, wskazują na węższe, choć nadal istotne, zyski. Opus 5 uzyskał wynik 43,4, statystycznie remisując z Kimi K3 i Fable 5, a jego poprawa w stosunku do Opus 4.8 była znacznie mniejsza niż w ARC-AGI-3. Model zidentyfikował ukryte zasady konwencjonalnej łamigłówki przed podjęciem jakichkolwiek działań, ale ustępował Opus 4.8 w grze z mniej znaną mechaniką. Ning sugeruje, że ten wzorzec pasuje do szkolenia na danych specyficznych dla gatunku, choć Witness nie jest w stanie zidentyfikować, jakich danych użył Anthropic.

Greg Kamradt, jeden z badaczy stojących za ARC-AGI-3, podkreśla, że wyniki te nie wykluczają szerszych zysków w rozumowaniu. Gra oparta na znanych mechanikach nie testuje adaptacji do nowości, a jeden słaby wynik nie przeważa nad ogólną poprawą modelu bez szczegółowych wyników dla tego konkretnego zadania. Witness został również zaprojektowany wokół łamigłówek w stylu ARC-AGI-3, więc lepsza wydajność może odzwierciedlać rzeczywisty transfer, a nie zapamiętywanie. Ning później wyjaśnił, że Opus 5 uogólnił się na Witness, ale w znacznie mniejszym stopniu niż na ARC-AGI-3. Porównał ten proces do ewolucji benchmarków kodowania, gdzie ARC-AGI-3, jako główny cel dla interaktywnego rozumowania, prawdopodobnie przyciągnie najpierw największe wysiłki szkoleniowe, a pokrycie większej liczby przypadków brzegowych może pomóc modelom uogólnić się na szerszy zakres abstrakcyjnych zadań rozumowania.

Sukces Claude Opus 5 w ARC-AGI-3 stanowi ważny krok w rozwoju sztucznej inteligencji, wskazując na postępy w zdolnościach rozumowania i adaptacji modeli do nowych, nieznanych wcześniej sytuacji. Wyniki te podkreślają rosnące możliwości AI w rozwiązywaniu złożonych problemów, które wymagają nie tylko przetwarzania danych, ale także głębszego zrozumienia i autonomicznego działania, co jest kluczowe dla rozwoju prawdziwej ogólnej sztucznej inteligencji (AGI).

Źródło: the-decoder.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Anthropic zainwestuje do 5 mld dolarów w układy AMD Instinct MI450 dla modeli Claude
Modele AI OpenAI i Anthropic próbowały oszukiwać w testach cyberbezpieczeństwa brytyjskiego instytutu
Edukatorzy na całym świecie zmieniają metody nauczania programowania w obliczu AI
Monday.com dołącza do firm technologicznych, które zwalniają pracowników, wskazując na AI jako przyczynę
Bibliotekarze uczą, jak wyłączyć sztuczną inteligencję w urządzeniach
Modele OpenAI wymknęły się spod kontroli i autonomicznie zhakowały Hugging Face

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.