Agenci AI nie potrafią ocenić upływu czasu ani jakości własnej pracy
Nowe badanie ujawnia, że popularne asystenty kodowania AI mają poważne problemy z przewidywaniem czasu trwania zadań i oceną własnych osiągnięć, co stanowi wyzwanie dla długotrwałych operacji.

Nowe badanie, przeprowadzone przez niezależnych naukowców w ramach programu MATS, ujawnia znaczący problem w funkcjonowaniu popularnych asystentów kodowania AI. Okazuje się, że agenci ci nie są w stanie wiarygodnie przewidzieć, ile czasu zajmie im wykonanie zadania, ani ocenić, jak długo już nad nim pracują. Ta niezdolność do zarządzania czasem stanowi poważne wyzwanie, zwłaszcza w kontekście długotrwałych operacji.
Problemy z szacowaniem czasu i samooceną
Naukowcy przetestowali dwa szeroko stosowane asystenty kodowania: Anthropic's Claude Code i OpenAI's Codex. Przed przystąpieniem do każdego zadania kodowania, agenci mieli za zadanie oszacować wymagany czas. Następnie rozwiązywali zadanie, a po jego zakończeniu raportowali, ile czasu upłynęło. Materiał testowy obejmował 200 zadań z kolekcji ProgramBench oraz 18 własnych benchmarków badaczy.
Wyniki były jednoznaczne: agenci konsekwentnie przeszacowywali potrzebny czas. Na przykład, w przypadku ProgramBench, oba modele najczęściej zgadywały około 90 minut, niezależnie od rzeczywistej trudności zadania. W drugiej rundzie testów, Claude mylił się średnio trzykrotnie, a Codex od sześciu do dziesięciu razy. Najgorsze były szacunki dla krótkich zadań; dopiero w zakresie wielogodzinnym niektóre przewidywania zbliżały się do rzeczywistości.
Co więcej, agenci wykazali się równie niską wiarygodnością w ocenie jakości własnej pracy. Starsze modele, takie jak Opus 4.8 i GPT-5.5, zawyżały swoje wyniki średnio o 20 punktów, przyznając sobie wysokie oceny nawet za zadania, które zakończyły się niepowodzeniem. W jednym przypadku oba modele oceniły swoją pracę na około 70 procent sukcesu, podczas gdy rzeczywiste wyniki wynosiły odpowiednio 7 i 14,5 procenta.
Wpływ środowiska oprogramowania i potencjalne rozwiązania
Badanie wykazało również, że wyniki zależą od konfiguracji oprogramowania, w której działają modele. Claude Code kontynuuje pracę, dopóki nie uzna, że zadanie jest zakończone, co zajmuje mu średnio około 90 minut. Z kolei Codex zatrzymuje się po około pół godzinie, niemal niezależnie od zadania. Według badania, ten sam model językowy wykonuje średnio 2,5 razy więcej kroków w środowisku Claude Code niż w Codexie. Oznacza to, że czas wykonania zadania zależy nie tylko od samego modelu, ale w dużej mierze od otaczającego go oprogramowania, zwanego „uprzężą” (harness).
Naukowcy podkreślają, że zdolność do samooceny ma kluczowe znaczenie. Aby agent mógł niezawodnie pracować nad długimi zadaniami trwającymi wiele godzin, musi być w stanie przestrzegać instrukcji typu „iteruj to zadanie przez dwie godziny”. Agent, który stale błędnie ocenia czas, jest trudny do kontrolowania. Autorzy badania planują dalsze testy, aby sprawdzić, czy agenci mogą przestrzegać ustalonego czasu pracy. Co ciekawe, gdy agenci uzyskali dostęp do narzędzia raportującego upływ czasu, ich oceny stały się niemal zawsze poprawne.
Wyniki tego badania rzucają światło na fundamentalne ograniczenia obecnych modeli AI w zakresie rozumienia i zarządzania czasem. Chociaż agenci AI wykazują imponujące zdolności w wielu dziedzinach, brak wewnętrznego „zegara” i precyzyjnej samooceny stanowi barierę w ich autonomicznej pracy nad złożonymi, długoterminowymi projektami. Integracja zewnętrznych narzędzi do śledzenia czasu może być kluczowym krokiem w kierunku zwiększenia ich użyteczności i niezawodności w przyszłych zastosowaniach.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Amazon wykorzystuje AI do walki z oszustwami, Alexa pomoże rozpoznać scamy
Amazon wprowadza nowe funkcje oparte na sztucznej inteligencji, aby pomóc klientom w identyfikacji fałszywych wiadomości i oszustw. Usługa Alexa for Shopping będzie teraz w stanie potwierdzić autentyczność komunikacji od
Redakcja Aigest11 godz. temu

Google DeepMind stawia na innowacje, ignorując ryzyko rynkowe i etyczne
Deklaracja szefa Google DeepMind o priorytecie innowacji w AI, w obliczu ostrzeżeń Banku Anglii i problemów z AI Overviews, budzi poważne pytania o odpowiedzialność liderów rynku.
Michał Chmielarz18 godz. temu
Meta Superintelligence Labs wprowadza Muse Voice Transcribe – jeden model dla transkrypcji, diaryzacji i detekcji końca
Meta Superintelligence Labs zaprezentowało Muse Voice Transcribe, innowacyjny model AI, który łączy funkcje transkrypcji mowy, rozdzielania mówców i detekcji końca wypowiedzi w jednym systemie, znacząco redukując opóźnie
Redakcja Aigest20 godz. temu

BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Artykuł analizuje skuteczność tradycyjnych benchmarków w ocenie dużych modeli językowych (LLM), wprowadzając koncepcję BenchMIRT, która ma lepiej oddawać ich rzeczywiste możliwości.
Redakcja Aigestwczoraj
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
OpenAI zapowiada model Astra, który jako pierwszy LLM osiągnął „krytyczny próg cyberbezpieczeństwa”, potrafiąc samodzielnie znajdować i wykorzystywać luki w systemach komputerowych. Firma planuje jego rychłe udostępnieni
Redakcja Aigestwczoraj

Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność
Google ogłosiło wprowadzenie agentowego rozumienia wideo dla swoich modeli Gemini Flash, co ma zrewolucjonizować analizę treści wideo, znacząco obniżając koszty i zwiększając precyzję.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.