Aigest.
Newsy

Artificial Analysis aktualizuje swój Indeks Inteligencji po kontrowersjach wokół oceny GPT-6 Astra

Firma Artificial Analysis wprowadziła wersję 4.2 swojego Indeksu Inteligencji, reagując na krytykę dotyczącą niedoszacowania postępów modelu GPT-6 Astra. Aktualizacja zmienia pozycję Astry w rankingu i wprowadza nowe ben

RA

Udostępnij
Artificial Analysis aktualizuje swój Indeks Inteligencji po kontrowersjach wokół oceny GPT-6 Astra
Fot. The Decoder

Firma Artificial Analysis opublikowała wersję 4.2 swojego Indeksu Inteligencji, co jest prawdopodobnie odpowiedzią na krytykę, że jej poprzednie benchmarki nie oddawały rzeczywistego postępu modelu GPT-6 Astra. Wcześniejsze oceny, w tym własne testy OpenAI, umieszczały Astrę znacznie przed konkurencją, podczas gdy Artificial Analysis oceniło ją na równi z poprzednią wersją.

Nowa ocena GPT-6 Astra i zmiany w rankingu

Przed aktualizacją, kilka niezależnych ewaluacji wskazywało na znaczną przewagę GPT-6 Astra. Epoch AI umieściło ją na pierwszym miejscu spośród 267 modeli, przyznając 169 punktów w ponad 50 benchmarkach. Testy ARC-AGI-3 również wykazały duży lub bardzo duży skok wydajności, zależnie od użytego narzędzia. Tymczasem Artificial Analysis początkowo oceniło Astrę jedynie na poziomie jej poprzednika.

Po wprowadzeniu zaktualizowanego indeksu, GPT-6 Astra wykazuje teraz czteropunktowy wzrost w stosunku do swojej poprzedniej wersji. W obecnym rankingu, model Anthropic Claude Fable 5.1 nadal zajmuje pozycję lidera, a za nim plasuje się Astra na drugim miejscu. Trzecie miejsce przypada modelowi Meta. Artificial Analysis podkreśla również, że Astra zużywa mniej tokenów na zadanie niż jakikolwiek inny model graniczny. Jeśli chodzi o stosunek kosztu do wydajności, czołowe pozycje dzielą Anthropic, OpenAI, Meta oraz Zhipu AI.

Ulepszenia w metodologii i nowe benchmarki

Aktualizacja Indeksu Inteligencji wprowadza dwa nowe benchmarki, mające na celu dokładniejsze odzwierciedlenie rzeczywistych zastosowań modeli AI:

  • AA-Briefcase – przeznaczony do oceny pracy z wiedzą w realnych scenariuszach.
  • GDP.pdf od Surge AI – służący do analizy dokumentów w formacie PDF.

Z indeksu usunięto benchmark GPQA-Diamond, ponieważ modele osiągnęły w nim już pełne opanowanie. Aby utrudnić manipulowanie wynikami, prywatne dane testowe stanowią teraz 40 procent wagi oceny. Artificial Analysis skorygowało również błędy w punktacji w kilku benchmarkach i dostosowało systemy oceniania, aby zapewnić bardziej stabilne rezultaty.

Firma Artificial Analysis wyjaśniła, że wstrzymywała się z wcześniejszymi aktualizacjami, aby utrzymać stabilność wyników podczas wprowadzania na rynek głównych modeli. Jednakże, ze względu na dynamiczne zmiany na szczycie tabeli liderów, konieczna okazała się aktualizacja tymczasowa. Firma poinformowała również, że wersja 5 indeksu jest w przygotowaniu od ośmiu miesięcy i będzie wprowadzana etapami.

Aktualizacja Indeksu Inteligencji przez Artificial Analysis odzwierciedla dynamiczny rozwój w dziedzinie sztucznej inteligencji i rosnącą potrzebę precyzyjnych narzędzi do oceny postępów modeli. Wprowadzenie nowych benchmarków i zwiększenie wagi prywatnych danych testowych ma na celu zapewnienie bardziej wiarygodnych i odpornych na manipulacje wyników, co jest kluczowe dla transparentności i dalszego rozwoju technologii AI.

Źródło: the-decoder.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

OpenAI prezentuje GPT-6 Astra: model do zastosowań komputerowych z kontekstem 1.05M i progiem cyberbezpieczeństwa
Google wprowadza Gemini 3.8 Flash, trzeci model Flash w sześć tygodni
AQuA: Nowatorski system AI do autonomicznego odkrywania czynników i rozwoju modeli w finansach ilościowych
OpenClaw 2.0: Przebudowany interfejs, szybsze uruchamianie i usprawniona konfiguracja modeli AI
Anthropic prezentuje samodoskonalącą się sztuczną inteligencję
GLM-5.3-Flash i Qwen3.8-Flash-Next: Chińskie laboratoria AI niezależnie tworzą podobne architektury

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.