Niezawodność agentów AI: IBM Research wprowadza nowe metryki i narzędzia do oceny spójności działania
IBM Research przedstawia nowe podejście do oceny niezawodności agentów AI, koncentrując się na spójności ich działania. Opracowane metryki i narzędzia mają pomóc w eliminowaniu problemów z powtarzalnością zadań w krytycz

Agenci sztucznej inteligencji, mimo imponujących osiągnięć w środowiskach testowych, często zawodzą w rzeczywistych zastosowaniach, gdy są proszeni o powtórzenie tego samego zadania. To zjawisko, określane jako problem niezawodności, staje się szczególnie krytyczne w przypadku zastosowań wymagających wysokiej precyzji, takich jak transakcje finansowe czy weryfikacja umów. IBM Research w swoim artykule z 15 września 2026 roku zwraca uwagę na tę lukę, wprowadzając nowe metryki i narzędzia do oceny i poprawy spójności działania agentów AI.
Luka w spójności: Mean@k kontra Pass^k
Dotychczasowe benchmarki, takie jak AppWorld, często ukrywają zmienność działania agentów za średnimi wynikami. Przykładem jest agent ReAct wykorzystujący model GPT-4.1, który osiągnął 77,4% skuteczności w pięciu powtórzeniach zadania (Mean@5). Jednakże, ten sam agent zdołał wykonać zadanie we wszystkich pięciu uruchomieniach tylko w 53,0% przypadków. Ta 24,4-punktowa różnica to tzw. luka w spójności (consistency gap), która pokazuje, jak często agent, który raz poradził sobie z zadaniem, może zawieść przy kolejnej próbie, mimo braku zmian w zadaniu.
IBM Research podkreśla, że większość benchmarków raportuje jedynie średnią skuteczność (Mean@k), która odpowiada na pytanie „jak dobry jest ten agent średnio?”. Nie odpowiada jednak na kluczowe pytanie użytkownika: „czy agent będzie równie dobry, jeśli poproszę go o to samo zadanie ponownie?”. Do tego celu wprowadzono metrykę Pass^k, która mierzy odsetek zadań, w których agent odnosi sukces we wszystkich k uruchomieniach. Ważne jest rozróżnienie Pass^k od Pass@k – to drugie, często używane w kontekście generowania kodu, mierzy, czy przynajmniej jedno z k uruchomień zakończyło się sukcesem, co jest podejściem optymistycznym. Pass^k jest jego pesymistycznym lustrzanym odbiciem, wymagającym sukcesu w każdej próbie. Zawsze zachodzi relacja: Pass^k ≤ Mean@k ≤ Pass@k.
Dlaczego agenci zawodzą: ostre kontra płaskie rozkłady prawdopodobieństwa
Problem niespójności nie wynika z braku możliwości agenta, lecz z natury podejmowanych przez niego decyzji. Każda decyzja agenta opartego na dużym modelu językowym (LLM) – np. wybór API czy argumentu – opiera się na rozkładzie prawdopodobieństwa kolejnych tokenów. Jeśli rozkład jest „ostry”, większość masy prawdopodobieństwa koncentruje się na jednym tokenie, co prowadzi do powtarzalnych wyborów. Natomiast „płaski” rozkład oznacza, że kilka tokenów ma zbliżone prawdopodobieństwo, co sprawia, że decyzja jest podatna na niewielkie zakłócenia, takie jak szumy obliczeniowe czy efekty uboczne platformy. Nawet niewielkie perturbacje mogą zmienić wynik, a ponieważ trajektoria agenta składa się z dziesiątek decyzji, mała szansa na zmianę na każdym kroku kumuluje się w dużą szansę na odmienne zachowanie w kolejnych uruchomieniach. To właśnie stąd bierze się wspomniana 24-punktowa luka.
Co istotne, problem ten nie jest eliminowany przez ustawienia dekodowania, takie jak greedy decoding czy stałe ziarno losowości, ponieważ te ustawienia kontrolują jedynie sposób przekształcania rozkładu w token, a nie sam rozkład. Nawet przy temperaturze 0.0, prawdopodobieństwa mogą się nieznacznie zmieniać między uruchomieniami, co prowadzi do niespójności.
Diagnoza i naprawa: Analizator Spójności i wytyczne
IBM Research opracowało dwuetapowy proces, który integruje się z istniejącym systemem ALTK-Evolve, aby diagnozować i naprawiać problemy ze spójnością:
-
Detekcja – Analizator Spójności (Consistency Analyzer): Narzędzie to analizuje zarejestrowaną trajektorię agenta, odtwarzając każdy krok decyzyjny poprzez kontrolowane ponowne próbkowanie. Mierzy, jak bardzo zmienia się wynik modelu w danym punkcie. Odbywa się to poprzez dodatkowe wywołanie modelu offline, które generuje k uzupełnień (domyślnie k=5) dla każdego kroku decyzyjnego. Wynikiem jest wynik spójności dla każdego kroku, który wskazuje, które decyzje są najbardziej podatne na zmiany. Analizator działa jako czarna skrzynka, nie wymagając dostępu do wewnętrznych mechanizmów modelu.
-
Generowanie – ukierunkowane wytyczne spójności: Każdy zidentyfikowany niestabilny krok staje się kandydatem na wytyczną spójności, która jest następnie wstrzykiwana do agenta w czasie wnioskowania. Przykładem takiej wytycznej, wygenerowanej przez GPT-4.1 dla zadania z AppWorld, jest: „Podczas zliczania znaczników typu checkbox w treści notatki, użyj dopasowania regex zakotwiczonego do linii, a nie zwykłego zliczania podciągów – tytuły notatek często powtarzają symbol znacznika w linii legendy.” Te wytyczne nie są specyficzne dla pojedynczej trajektorii, lecz dotyczą ogólnych wzorców niestabilności, które mogą pojawiać się w wielu zadaniach.
Wyniki: redukcja luki bez utraty dokładności
Testy przeprowadzone na 168 zadaniach z AppWorld z agentem ReAct opartym na GPT-4.1 wykazały znaczną poprawę. Luka w spójności została zmniejszona o około połowę: Pass^5 wzrosło z 53,0% do 69,0%, podczas gdy Mean@5 wzrosło z 77,4% do 81,0%. To zmniejszyło lukę z 24,4 do 12,0 punktów procentowych. Prawie jedna trzecia wcześniej niespójnych zadań stała się zadaniami, które agent wykonuje poprawnie w każdym uruchomieniu. Największe zyski odnotowano w zadaniach o średnim (+22,9 pp) i trudnym (+14,3 pp) poziomie trudności.
Co kluczowe, średnia dokładność (Mean@5) nigdy nie spadła, a w niektórych przypadkach nawet się poprawiła. To pokazuje, że system nie tylko zwiększa spójność, ale robi to bez poświęcania ogólnej wydajności. Wytyczne okazały się również uogólnialne, poprawiając Pass^5 o +13,0 pp w podobnych, ale innych zadaniach, co sugeruje, że wychwytują one prawdziwie uniwersalne wzorce błędów, a nie tylko specyfikę jednej trajektorii. Nawet w przypadku słabszego modelu, gpt-oss-120b, Pass^5 wzrosło o +6,0 pp.
Implikacje dla wdrażania agentów AI
IBM Research zaleca, aby twórcy agentów AI raportowali Pass^k obok Mean@k, ponieważ średnie wyniki nie są w stanie odróżnić niezawodnego agenta od szczęśliwego. Luka w spójności będzie rosła wraz z trudnością zadania, a w przypadku najtrudniejszych zadań pojedyncza średnia jest najbardziej myląca. Zamiast od razu sięgać po większy model, warto skupić się na spójności, która jest ortogonalna do możliwości agenta. Diagnoza problemów ze spójnością nie wymaga skomplikowanych narzędzi ani ponownego uruchamiania zadań w środowisku produkcyjnym – wystarczy jedno dodatkowe wywołanie LLM na krok decyzyjny. Narzędzia ALTK-Evolve, włączając Analizator Spójności i generowanie wytycznych, są dostępne w repozytorium open-source.
Nowe podejście IBM Research do oceny i poprawy spójności działania agentów AI stanowi istotny krok w kierunku budowania bardziej niezawodnych i przewidywalnych systemów. W miarę jak agenci AI będą odgrywać coraz większą rolę w krytycznych procesach biznesowych i codziennym życiu, zdolność do konsekwentnego wykonywania zadań stanie się równie ważna, jak ich ogólna skuteczność. Zrozumienie i adresowanie luki w spójności pozwoli na tworzenie agentów, na których użytkownicy będą mogli polegać w każdych warunkach.
Źródło: huggingface.co
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Badanie: Prawie co piąty badacz AI przewiduje scenariusz zagłady ludzkości z powodu sztucznej inteligencji
Najnowsze badanie AI Impacts ujawnia, że średnio 18% badaczy AI uważa, iż sztuczna inteligencja może doprowadzić do wyginięcia lub trwałego osłabienia ludzkości. Obawy te narastają, a naukowcy wskazują na szybkie tempo r
Redakcja Aigest6 godz. temu
Prior Labs prezentuje TabPFN-3.5: Model fundamentowy dla danych tabelarycznych, który przewyższa zwycięskie rozwiązanie
Prior Labs wprowadziło TabPFN-3.5, model fundamentowy dla danych tabelarycznych, który został wytrenowany wyłącznie na syntetycznych danych i osiągnął lepsze wyniki niż zwycięskie rozwiązanie konkursu Otto Kaggle.
Redakcja Aigest10 godz. temu

Modele AI typu open-source doganiają droższe odpowiedniki: 4 miesiące przewagi za pięciokrotność kosztów
Najnowszy raport Mozilli wskazuje, że modele AI typu open-source znacząco zmniejszyły dystans wydajnościowy do droższych, zamkniętych modeli, oferując podobne możliwości za ułamek ceny. Firmy coraz częściej wybierają tań
Redakcja Aigestwczoraj

Apple wprowadza odnowioną Siri opartą na Google Gemini, ale początkowo bez UE
Apple udostępnia nową generację Siri, zasilaną modelami Google Gemini, oferującą zaawansowane funkcje kontekstowe i integrację z aplikacjami, jednak początkowo nie będzie dostępna w Unii Europejskiej.
Redakcja Aigestwczoraj

Inwestycje w centra danych AI: bilionowy zakład z wysokim ryzykiem
Gigantyczne inwestycje w centra danych AI, szacowane na biliony dolarów, budzą obawy o ich opłacalność i stabilność finansową firm technologicznych, a także o szersze konsekwencje dla gospodarki.
Redakcja Aigestwczoraj

Spowolnienie rozwoju AI: Czy bezpieczeństwo to tylko zasłona dymna dla dominacji rynkowej?
Propozycje gigantów AI, takich jak OpenAI i Anthropic, dotyczące spowolnienia rozwoju sztucznej inteligencji, rzekomo w imię bezpieczeństwa, budzą kontrowersje i oskarżenia o próbę monopolizacji rynku.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.