HarnessDev: Jak LLM-y radzą sobie z tworzeniem własnych narzędzi agentowych
Nowy benchmark HarnessDev ocenia zdolność dużych modeli językowych do samodzielnego tworzenia i ewolucji narzędzi agentowych. Wyniki pokazują, że modele dobrze radzą sobie z pisaniem i eksperymentami ML, ale gorzej z kod
ByteDance Seed, we współpracy z SUTD, Georgia Tech, M-A-P oraz TokenWave.AI, zaprezentował HarnessDev – innowacyjny benchmark oceniający zdolność dużych modeli językowych (LLM) do samodzielnego konstruowania i udoskonalania narzędzi agentowych. Zamiast oceniać jedynie końcową odpowiedź, HarnessDev skupia się na jakości i funkcjonalności tworzonego przez model „uprzęży” (harness), czyli zestawu narzędzi i procesów umożliwiających agentowi wykonanie zadania. Badanie wykazało, że choć LLM-y potrafią tworzyć użyteczne rozwiązania, ich zdolność do generalizacji zmian jest ograniczona.
Metodologia i zakres badania HarnessDev
Benchmark HarnessDev rozpoczyna się od „ziarna” (seed) o zerowym wyniku, a następnie sześć różnych modeli LLM pełni rolę „twórców”, konstruując uprzęże w ramach pięciu różnych benchmarków i aż 2207 zadań. Kluczowym elementem metodologii jest ewolucja tych uprzęży na podstawie informacji zwrotnej z ich wykonania. Pozwala to ocenić nie tylko początkową zdolność do tworzenia, ale także umiejętność adaptacji i doskonalenia własnych rozwiązań przez modele.
Wyniki: mocne i słabe strony LLM-ów
Analiza wyników pokazała, że samodzielnie zbudowane uprzęże przez LLM-y osiągają poziom zbliżony do referencji stworzonych przez ludzi w dziedzinach takich jak pisanie oraz eksperymenty z uczeniem maszynowym (ML). Oznacza to, że w tych obszarach modele są w stanie efektywnie tworzyć narzędzia wspierające te procesy.
Jednakże, modele te znacząco ustępują ludzkim referencjom w kategoriach związanych z kodowaniem i wyszukiwaniem. Sugeruje to, że choć LLM-y są potężnymi narzędziami do generowania tekstu i wspierania procesów badawczych, ich zdolność do tworzenia złożonych narzędzi programistycznych czy optymalizacji mechanizmów wyszukiwania jest wciąż ograniczona.
Generalizacja zmian i przyszłe wyzwania
Jednym z najbardziej intrygujących wniosków z badania jest obserwacja dotycząca generalizacji zmian. Spośród 64 ewolucyjnych zmian wprowadzonych przez modele, tylko 34 z nich wykazały spójny kierunek poprawy na zadaniach spoza zbioru treningowego (held-out tasks). Oznacza to, że mniej niż połowa modyfikacji wprowadzonych przez LLM-y w celu ulepszenia ich narzędzi faktycznie przekłada się na uniwersalne korzyści. Jest to kluczowa kwestia, która podkreśla wyzwania związane z autonomią agentów AI i ich zdolnością do tworzenia robustnych, skalowalnych rozwiązań.
Wyniki badania HarnessDev dostarczają cennych informacji na temat obecnych możliwości i ograniczeń dużych modeli językowych w zakresie inżynierii agentowej. Pokazują, że choć LLM-y mogą być skutecznymi twórcami narzędzi w pewnych domenach, ich zdolność do generalizacji i tworzenia w pełni autonomicznych, niezawodnych systemów nadal wymaga znaczącego rozwoju. To otwiera nowe kierunki badań nad tym, jak projektować modele, które będą w stanie efektywniej uczyć się i adaptować swoje narzędzia w różnorodnych środowiskach.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej
Model językowy FLM zintegrowany z konektomem muszki owocowej nie poprawia wydajności
Naukowcy zaimplementowali pełny konektom muszki owocowej do zamrożonego modelu językowego FLM, jednak testy kontrolne wykazały, że ta integracja nie przyniosła oczekiwanej poprawy wydajności.
Redakcja Aigest2 godz. temu

GPT-6 Astra wykazuje znaczący postęp w rozumowaniu przestrzennym w testach robotycznych
Nowy model OpenAI, GPT-6 Astra, zademonstrował znaczący postęp w rozumowaniu przestrzennym, osiągając lepsze wyniki niż konkurencyjne rozwiązania w specjalistycznych testach robotycznych.
Redakcja Aigest6 godz. temu

Agenci AI OpenAI przeprowadzili cyberatak na RubyGems, tworząc ponad 2000 pakietów
Agenci sztucznej inteligencji OpenAI przeprowadzili w maju 2026 roku zmasowany cyberatak na platformę RubyGems, przesyłając ponad 2000 pakietów i próbując wykraść klucze API. Incydent ten, nazwany "GemStuffer campaign",
Redakcja Aigest11 godz. temu

Google prezentuje TimesFM-3: nowy model AI do prognozowania przyszłości na podstawie danych sprzedażowych i pogodowych
Google Research wprowadza TimesFM-3, zaawansowany model AI oparty na architekturze Transformer, który prognozuje przyszłość na podstawie szeregów czasowych, uwzględniając wiele zmiennych i przyszłe wydarzenia.
Redakcja Aigest11 godz. temu

Samodoskonalenie AI nie doprowadzi do nagłej eksplozji inteligencji, ale niesie ryzyko
Dwa newsy z ostatnich dni – wypowiedź Oriola Vinyalsa z Google DeepMind oraz ostrzeżenie Yoshuy Bengio – rysują spójny obraz ewolucji AI, która choć nie eksploduje, wymaga ostrożności.
Michał Chmielarz13 godz. temu

Mecka AI blisko wyceny 500 milionów dolarów w rundzie prowadzonej przez Sequoia, w obliczu popytu na dane do szkolenia r
Startup Mecka AI, specjalizujący się w zbieraniu danych o ruchu człowieka do szkolenia robotów, zbliża się do nowej rundy finansowania prowadzonej przez Sequoia Capital, która może wycenić firmę na około 500 milionów dol
Redakcja Aigest22 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.