Aigest.
Newsy

Agenci AI nie potrafią ocenić upływu czasu ani jakości własnej pracy

Nowe badanie ujawnia, że popularne asystenty kodowania AI mają poważne problemy z przewidywaniem czasu trwania zadań i oceną własnych osiągnięć, co stanowi wyzwanie dla długotrwałych operacji.

RA

Udostępnij
Agenci AI nie potrafią ocenić upływu czasu ani jakości własnej pracy
Fot. The Decoder

Nowe badanie, przeprowadzone przez niezależnych naukowców w ramach programu MATS, ujawnia znaczący problem w funkcjonowaniu popularnych asystentów kodowania AI. Okazuje się, że agenci ci nie są w stanie wiarygodnie przewidzieć, ile czasu zajmie im wykonanie zadania, ani ocenić, jak długo już nad nim pracują. Ta niezdolność do zarządzania czasem stanowi poważne wyzwanie, zwłaszcza w kontekście długotrwałych operacji.

Problemy z szacowaniem czasu i samooceną

Naukowcy przetestowali dwa szeroko stosowane asystenty kodowania: Anthropic's Claude Code i OpenAI's Codex. Przed przystąpieniem do każdego zadania kodowania, agenci mieli za zadanie oszacować wymagany czas. Następnie rozwiązywali zadanie, a po jego zakończeniu raportowali, ile czasu upłynęło. Materiał testowy obejmował 200 zadań z kolekcji ProgramBench oraz 18 własnych benchmarków badaczy.

Wyniki były jednoznaczne: agenci konsekwentnie przeszacowywali potrzebny czas. Na przykład, w przypadku ProgramBench, oba modele najczęściej zgadywały około 90 minut, niezależnie od rzeczywistej trudności zadania. W drugiej rundzie testów, Claude mylił się średnio trzykrotnie, a Codex od sześciu do dziesięciu razy. Najgorsze były szacunki dla krótkich zadań; dopiero w zakresie wielogodzinnym niektóre przewidywania zbliżały się do rzeczywistości.

Co więcej, agenci wykazali się równie niską wiarygodnością w ocenie jakości własnej pracy. Starsze modele, takie jak Opus 4.8 i GPT-5.5, zawyżały swoje wyniki średnio o 20 punktów, przyznając sobie wysokie oceny nawet za zadania, które zakończyły się niepowodzeniem. W jednym przypadku oba modele oceniły swoją pracę na około 70 procent sukcesu, podczas gdy rzeczywiste wyniki wynosiły odpowiednio 7 i 14,5 procenta.

Wpływ środowiska oprogramowania i potencjalne rozwiązania

Badanie wykazało również, że wyniki zależą od konfiguracji oprogramowania, w której działają modele. Claude Code kontynuuje pracę, dopóki nie uzna, że zadanie jest zakończone, co zajmuje mu średnio około 90 minut. Z kolei Codex zatrzymuje się po około pół godzinie, niemal niezależnie od zadania. Według badania, ten sam model językowy wykonuje średnio 2,5 razy więcej kroków w środowisku Claude Code niż w Codexie. Oznacza to, że czas wykonania zadania zależy nie tylko od samego modelu, ale w dużej mierze od otaczającego go oprogramowania, zwanego „uprzężą” (harness).

Naukowcy podkreślają, że zdolność do samooceny ma kluczowe znaczenie. Aby agent mógł niezawodnie pracować nad długimi zadaniami trwającymi wiele godzin, musi być w stanie przestrzegać instrukcji typu „iteruj to zadanie przez dwie godziny”. Agent, który stale błędnie ocenia czas, jest trudny do kontrolowania. Autorzy badania planują dalsze testy, aby sprawdzić, czy agenci mogą przestrzegać ustalonego czasu pracy. Co ciekawe, gdy agenci uzyskali dostęp do narzędzia raportującego upływ czasu, ich oceny stały się niemal zawsze poprawne.

Wyniki tego badania rzucają światło na fundamentalne ograniczenia obecnych modeli AI w zakresie rozumienia i zarządzania czasem. Chociaż agenci AI wykazują imponujące zdolności w wielu dziedzinach, brak wewnętrznego „zegara” i precyzyjnej samooceny stanowi barierę w ich autonomicznej pracy nad złożonymi, długoterminowymi projektami. Integracja zewnętrznych narzędzi do śledzenia czasu może być kluczowym krokiem w kierunku zwiększenia ich użyteczności i niezawodności w przyszłych zastosowaniach.

Źródło: the-decoder.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Amazon wykorzystuje AI do walki z oszustwami, Alexa pomoże rozpoznać scamy
Google DeepMind stawia na innowacje, ignorując ryzyko rynkowe i etyczne
Meta Superintelligence Labs wprowadza Muse Voice Transcribe – jeden model dla transkrypcji, diaryzacji i detekcji końca
BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.