Artificial Analysis aktualizuje swój Indeks Inteligencji po kontrowersjach wokół oceny GPT-6 Astra
Firma Artificial Analysis wprowadziła wersję 4.2 swojego Indeksu Inteligencji, reagując na krytykę dotyczącą niedoszacowania postępów modelu GPT-6 Astra. Aktualizacja zmienia pozycję Astry w rankingu i wprowadza nowe ben

Firma Artificial Analysis opublikowała wersję 4.2 swojego Indeksu Inteligencji, co jest prawdopodobnie odpowiedzią na krytykę, że jej poprzednie benchmarki nie oddawały rzeczywistego postępu modelu GPT-6 Astra. Wcześniejsze oceny, w tym własne testy OpenAI, umieszczały Astrę znacznie przed konkurencją, podczas gdy Artificial Analysis oceniło ją na równi z poprzednią wersją.
Nowa ocena GPT-6 Astra i zmiany w rankingu
Przed aktualizacją, kilka niezależnych ewaluacji wskazywało na znaczną przewagę GPT-6 Astra. Epoch AI umieściło ją na pierwszym miejscu spośród 267 modeli, przyznając 169 punktów w ponad 50 benchmarkach. Testy ARC-AGI-3 również wykazały duży lub bardzo duży skok wydajności, zależnie od użytego narzędzia. Tymczasem Artificial Analysis początkowo oceniło Astrę jedynie na poziomie jej poprzednika.
Po wprowadzeniu zaktualizowanego indeksu, GPT-6 Astra wykazuje teraz czteropunktowy wzrost w stosunku do swojej poprzedniej wersji. W obecnym rankingu, model Anthropic Claude Fable 5.1 nadal zajmuje pozycję lidera, a za nim plasuje się Astra na drugim miejscu. Trzecie miejsce przypada modelowi Meta. Artificial Analysis podkreśla również, że Astra zużywa mniej tokenów na zadanie niż jakikolwiek inny model graniczny. Jeśli chodzi o stosunek kosztu do wydajności, czołowe pozycje dzielą Anthropic, OpenAI, Meta oraz Zhipu AI.
Ulepszenia w metodologii i nowe benchmarki
Aktualizacja Indeksu Inteligencji wprowadza dwa nowe benchmarki, mające na celu dokładniejsze odzwierciedlenie rzeczywistych zastosowań modeli AI:
- AA-Briefcase – przeznaczony do oceny pracy z wiedzą w realnych scenariuszach.
- GDP.pdf od Surge AI – służący do analizy dokumentów w formacie PDF.
Z indeksu usunięto benchmark GPQA-Diamond, ponieważ modele osiągnęły w nim już pełne opanowanie. Aby utrudnić manipulowanie wynikami, prywatne dane testowe stanowią teraz 40 procent wagi oceny. Artificial Analysis skorygowało również błędy w punktacji w kilku benchmarkach i dostosowało systemy oceniania, aby zapewnić bardziej stabilne rezultaty.
Firma Artificial Analysis wyjaśniła, że wstrzymywała się z wcześniejszymi aktualizacjami, aby utrzymać stabilność wyników podczas wprowadzania na rynek głównych modeli. Jednakże, ze względu na dynamiczne zmiany na szczycie tabeli liderów, konieczna okazała się aktualizacja tymczasowa. Firma poinformowała również, że wersja 5 indeksu jest w przygotowaniu od ośmiu miesięcy i będzie wprowadzana etapami.
Aktualizacja Indeksu Inteligencji przez Artificial Analysis odzwierciedla dynamiczny rozwój w dziedzinie sztucznej inteligencji i rosnącą potrzebę precyzyjnych narzędzi do oceny postępów modeli. Wprowadzenie nowych benchmarków i zwiększenie wagi prywatnych danych testowych ma na celu zapewnienie bardziej wiarygodnych i odpornych na manipulacje wyników, co jest kluczowe dla transparentności i dalszego rozwoju technologii AI.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej
OpenAI prezentuje GPT-6 Astra: model do zastosowań komputerowych z kontekstem 1.05M i progiem cyberbezpieczeństwa
OpenAI wprowadziło GPT-6 Astra, nowy model AI przeznaczony do interakcji z komputerem, oferujący rozszerzony kontekst 1.05 miliona tokenów. Jest to pierwszy model firmy, który przekroczył krytyczny próg cyberbezpieczeńst
Redakcja Aigestwczoraj

Google wprowadza Gemini 3.8 Flash, trzeci model Flash w sześć tygodni
Google zaprezentowało Gemini 3.8 Flash, swój trzeci model Flash w ciągu zaledwie sześciu tygodni, oferując ulepszone możliwości rozumowania i kodowania, a także specjalistyczną wersję Cyber do wykrywania luk.
Redakcja Aigest3 dni temu

AQuA: Nowatorski system AI do autonomicznego odkrywania czynników i rozwoju modeli w finansach ilościowych
Naukowcy z Princeton, Ant Group i Stanforda przedstawili AQuA – dwuczęściowy system oparty na modelach językowych, który autonomicznie ulepsza procesy badawcze w finansach ilościowych, minimalizując ryzyko błędów.
Redakcja Aigest4 dni temu

OpenClaw 2.0: Przebudowany interfejs, szybsze uruchamianie i usprawniona konfiguracja modeli AI
Zespół OpenClaw wydał wersję 2.0 swojego narzędzia, wprowadzając znaczące zmiany w instalacji, interfejsie użytkownika oraz zarządzaniu sesjami. Nowa odsłona koncentruje się na poprawie wydajności i elastyczności.
Redakcja Aigest5 dni temu

Anthropic prezentuje samodoskonalącą się sztuczną inteligencję
Badacz z Anthropic ujawnił wgląd w system AI zdolny do samodzielnego ulepszania swojego działania, co może zwiastować nową erę w rozwoju sztucznej inteligencji.
Redakcja Aigest28 sie 2026

GLM-5.3-Flash i Qwen3.8-Flash-Next: Chińskie laboratoria AI niezależnie tworzą podobne architektury
Dwa czołowe chińskie laboratoria AI, Z.ai i Alibaba, niezależnie opracowały nowe modele językowe GLM-5.3-Flash i Qwen3.8-Flash-Next, które wykazują zaskakująco zbieżne rozwiązania architektoniczne.
Redakcja Aigest28 sie 2026
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.