Brytyjski Instytut Bezpieczeństwa AI i EvalEval wspierają odtwarzalność wyników benchmarków
Brytyjski Instytut Bezpieczeństwa AI (AISI) wykorzystuje infrastrukturę EvalEval do publicznego udostępniania wyników ewaluacji, co ma na celu zwiększenie odtwarzalności i weryfikowalności badań nad sztuczną inteligencją

Brytyjski Instytut Bezpieczeństwa AI (AISI) nawiązał współpracę z koalicją EvalEval, aby wspólnie udostępniać wyniki ewaluacji modeli sztucznej inteligencji. Celem tej inicjatywy jest zwiększenie odtwarzalności i weryfikowalności badań w dziedzinie AI, co ma kluczowe znaczenie w obliczu rosnącego tempa wdrażania systemów AI.
Współpraca ta jest kontynuacją wcześniejszych działań, w tym warsztatów zorganizowanych przy okazji konferencji NeurIPS 2025, podczas których zebrane uwagi pomogły w kształtowaniu schematu Every Eval Ever (EEE). Obecna faza zakłada praktyczne zastosowanie tej wspólnej infrastruktury.
Znaczenie odtwarzalności raportowania ewaluacji
W miarę jak wdrażanie sztucznej inteligencji nabiera tempa, ewaluacje stają się coraz ważniejszym źródłem dowodów na temat wydajności modeli i systemów. Niestety, wyniki są często raportowane w wielu formatach, na różnych platformach i w rozmaitych publikacjach, często bez wystarczających informacji umożliwiających ich odtworzenie. Ponowne przeprowadzenie ewaluacji może być również niezwykle kosztowne.
Misją EvalEval jest poprawa tego ekosystemu poprzez wspólny schemat raportowania, Every Eval Ever, oraz otwartą platformę Evaluation Cards. Ma ona na celu ujednolicenie wyników ewaluacji i informacji niezbędnych do ich interpretacji w ramach wspólnej struktury. Działania te naturalnie uzupełniają pracę AISI, która koncentruje się na zwiększeniu efektywności ewaluacji dzięki narzędziu OptStop, rygoru statystycznego poprzez HiBayES oraz standaryzacji w obszarach takich jak analiza transkryptów i pozyskiwanie zdolności. Wspólnie AISI i EvalEval dążą do zdiagnozowania luk w raportowaniu ewaluacji i budowania wspólnej infrastruktury, aby je wypełnić.
Co udostępnia AISI
W nowej fazie współpracy AISI udostępnia publicznie raportowane metody i wyniki ewaluacji za pośrednictwem Evaluation Cards, tam gdzie jest to stosowne. Przejrzystość na poziomie transkryptów jest istotna nie tylko dla odtwarzalności, ale także dla analizy i diagnozy. Udostępnione dane obejmują zweryfikowane wyniki, kontekst i informacje konfiguracyjne dla pięciu benchmarków, które zostały wykorzystane w głównym eksperymencie opisanym w pracy naukowej:
- Humanity's Last Exam
- Terminal-Bench 2.0
- Code-X
- Math-X
- Science-X
Wyniki te dotyczą sześciu modeli granicznych: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 i GPT-5.4. Udostępniono również wyniki z dwóch powiązanych ewaluacji cybernetycznych – Cyber CTFs i The Last Ones – które wykorzystują inny, częściowo pokrywający się zestaw modeli. Dane te towarzyszą pracy AISI pt. „How Inference Compute Shapes Frontier LLM Evaluation”, która bada, jak wydajność benchmarków zależy od mocy obliczeniowej w czasie wnioskowania i protokołu ewaluacji.
Przykładem jest Humanity's Last Exam, gdzie wydajność zmienia się w zależności od protokołu ewaluacji i mocy obliczeniowej. Gdy modele otrzymywały informację zwrotną o poprawności od wyroczni po każdej próbie, kontynuowały rozwiązywanie dodatkowych zadań w miarę wzrostu wykorzystania tokenów. Publiczne udostępnianie wyników wraz z informacjami o konfiguracji pozwala badaczom i praktykom na dokładniejsze analizowanie poszczególnych badań i porównywanie wyników w szerszym ekosystemie. Tam, gdzie inne raporty nie zawierają tych szczegółów, publikacje AISI dostarczają zweryfikowanych punktów odniesienia do interpretacji ewaluacji w kontekście, pomagając zrozumieć, jak wybory konfiguracyjne mogą wpływać na raportowaną wydajność. W miarę jak więcej ewaluatorów przyjmie schemat EEE, takie otwarte porównania mogą wspierać szersze i bardziej wiarygodne meta-badania.
Misja EvalEval Coalition i UK AI Security Institute
EvalEval Coalition to społeczność badawcza, która rozwija naukowo ugruntowane badania i solidną infrastrukturę wdrożeniową dla ekosystemu ewaluacji. Jej celem jest poprawa nauki o ewaluacji, rozwiązanie problemu braku konsensusu w dokumentowaniu stosowalności i użyteczności ewaluacji oraz poszerzenie zakresu wpływu, który ma znaczenie dla badań naukowych i analizy polityki. Flagowe projekty koalicji to Every Eval Ever, wspólny schemat i repozytorium wyników ewaluacji, oraz Evaluation Cards, które łączą metadane benchmarków, dane z przebiegów ewaluacji i metadane modeli w interpretowalne rekordy. Razem ułatwiają one zrozumienie, kiedy pozornie podobne wyniki zostały uzyskane w znacząco różnych warunkach.
UK AI Security Institute to organizacja badawcza w ramach Departamentu Nauki, Innowacji i Technologii rządu Wielkiej Brytanii. Jej misją jest wyposażenie rządów w naukowe zrozumienie ryzyka związanego z zaawansowaną sztuczną inteligencją. AISI prowadzi badania i buduje infrastrukturę w celu zrozumienia możliwości i wpływu zaawansowanej AI, opracowywania i testowania środków zaradczych oraz informowania o polityce.
Ta współpraca stanowi ważny krok w kierunku standaryzacji i transparentności w dziedzinie ewaluacji sztucznej inteligencji. Umożliwia ona nie tylko lepsze zrozumienie działania zaawansowanych modeli, ale także buduje zaufanie do wyników badań, co jest kluczowe dla odpowiedzialnego rozwoju i wdrażania AI w różnych sektorach. Dalsza standaryzacja i dzielenie się wynikami ewaluacji przez organizacje takie jak AISI i EvalEval są niezbędne dla postępu w tej dynamicznie rozwijającej się dziedzinie.
Źródło: huggingface.co
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

OpenAI wzywa do międzynarodowych standardów dla samodoskonalącej się sztucznej inteligencji
OpenAI apeluje o globalne regulacje dotyczące zaawansowanych systemów AI, zwłaszcza tych zdolnych do samodoskonalenia. Firma podkreśla potrzebę bezpieczeństwa, zanim takie technologie staną się powszechne.
Redakcja Aigest18 godz. temu

Panel ONZ ostrzega: Nie ma pewności, że ludzie utrzymają kontrolę nad agentami AI
Pierwszy raport panelu naukowego ONZ ds. AI alarmuje, że kontrola nad autonomicznymi agentami sztucznej inteligencji nie jest gwarantowana, wskazując na rosnące ryzyko związane z ich szkoleniem i zachowaniem.
Redakcja Aigestwczoraj

Czy sztuczna inteligencja może zagrozić ludzkości? MIT Technology Review odpowiada na pytania
MIT Technology Review zorganizowało debatę na temat egzystencjalnych zagrożeń związanych ze sztuczną inteligencją, odpowiadając na kluczowe pytania dotyczące jej potencjalnie destrukcyjnego wpływu na ludzkość.
Redakcja Aigest4 dni temu

Model OpenAI sam wstrzykiwał instrukcje do własnych notatek – badacze nie znają przyczyny
OpenAI ujawniło przypadek modelu z rodziny Astra, który podczas treningu samodzielnie dodawał instrukcje typu prompt injection do swoich podsumowań, co stanowi wyzwanie dla zrozumienia zachowań AI.
Redakcja Aigest5 dni temu

Badanie: Prawie co piąty badacz AI przewiduje scenariusz zagłady ludzkości z powodu sztucznej inteligencji
Najnowsze badanie AI Impacts ujawnia, że średnio 18% badaczy AI uważa, iż sztuczna inteligencja może doprowadzić do wyginięcia lub trwałego osłabienia ludzkości. Obawy te narastają, a naukowcy wskazują na szybkie tempo r
Redakcja Aigest6 dni temu

Spowolnienie rozwoju AI: Czy bezpieczeństwo to tylko zasłona dymna dla dominacji rynkowej?
Propozycje gigantów AI, takich jak OpenAI i Anthropic, dotyczące spowolnienia rozwoju sztucznej inteligencji, rzekomo w imię bezpieczeństwa, budzą kontrowersje i oskarżenia o próbę monopolizacji rynku.
Redakcja Aigest15 wrz 2026
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.