Aigest.
Newsy

HarnessDev: Jak LLM-y radzą sobie z tworzeniem własnych narzędzi agentowych

Nowy benchmark HarnessDev ocenia zdolność dużych modeli językowych do samodzielnego tworzenia i ewolucji narzędzi agentowych. Wyniki pokazują, że modele dobrze radzą sobie z pisaniem i eksperymentami ML, ale gorzej z kod

RA

Udostępnij
HarnessDev: Jak LLM-y radzą sobie z tworzeniem własnych narzędzi agentowych
Ilustracja poglądowa

ByteDance Seed, we współpracy z SUTD, Georgia Tech, M-A-P oraz TokenWave.AI, zaprezentował HarnessDev – innowacyjny benchmark oceniający zdolność dużych modeli językowych (LLM) do samodzielnego konstruowania i udoskonalania narzędzi agentowych. Zamiast oceniać jedynie końcową odpowiedź, HarnessDev skupia się na jakości i funkcjonalności tworzonego przez model „uprzęży” (harness), czyli zestawu narzędzi i procesów umożliwiających agentowi wykonanie zadania. Badanie wykazało, że choć LLM-y potrafią tworzyć użyteczne rozwiązania, ich zdolność do generalizacji zmian jest ograniczona.

Metodologia i zakres badania HarnessDev

Benchmark HarnessDev rozpoczyna się od „ziarna” (seed) o zerowym wyniku, a następnie sześć różnych modeli LLM pełni rolę „twórców”, konstruując uprzęże w ramach pięciu różnych benchmarków i aż 2207 zadań. Kluczowym elementem metodologii jest ewolucja tych uprzęży na podstawie informacji zwrotnej z ich wykonania. Pozwala to ocenić nie tylko początkową zdolność do tworzenia, ale także umiejętność adaptacji i doskonalenia własnych rozwiązań przez modele.

Wyniki: mocne i słabe strony LLM-ów

Analiza wyników pokazała, że samodzielnie zbudowane uprzęże przez LLM-y osiągają poziom zbliżony do referencji stworzonych przez ludzi w dziedzinach takich jak pisanie oraz eksperymenty z uczeniem maszynowym (ML). Oznacza to, że w tych obszarach modele są w stanie efektywnie tworzyć narzędzia wspierające te procesy.

Jednakże, modele te znacząco ustępują ludzkim referencjom w kategoriach związanych z kodowaniem i wyszukiwaniem. Sugeruje to, że choć LLM-y są potężnymi narzędziami do generowania tekstu i wspierania procesów badawczych, ich zdolność do tworzenia złożonych narzędzi programistycznych czy optymalizacji mechanizmów wyszukiwania jest wciąż ograniczona.

Generalizacja zmian i przyszłe wyzwania

Jednym z najbardziej intrygujących wniosków z badania jest obserwacja dotycząca generalizacji zmian. Spośród 64 ewolucyjnych zmian wprowadzonych przez modele, tylko 34 z nich wykazały spójny kierunek poprawy na zadaniach spoza zbioru treningowego (held-out tasks). Oznacza to, że mniej niż połowa modyfikacji wprowadzonych przez LLM-y w celu ulepszenia ich narzędzi faktycznie przekłada się na uniwersalne korzyści. Jest to kluczowa kwestia, która podkreśla wyzwania związane z autonomią agentów AI i ich zdolnością do tworzenia robustnych, skalowalnych rozwiązań.

Wyniki badania HarnessDev dostarczają cennych informacji na temat obecnych możliwości i ograniczeń dużych modeli językowych w zakresie inżynierii agentowej. Pokazują, że choć LLM-y mogą być skutecznymi twórcami narzędzi w pewnych domenach, ich zdolność do generalizacji i tworzenia w pełni autonomicznych, niezawodnych systemów nadal wymaga znaczącego rozwoju. To otwiera nowe kierunki badań nad tym, jak projektować modele, które będą w stanie efektywniej uczyć się i adaptować swoje narzędzia w różnorodnych środowiskach.

Źródło: marktechpost.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Model językowy FLM zintegrowany z konektomem muszki owocowej nie poprawia wydajności
GPT-6 Astra wykazuje znaczący postęp w rozumowaniu przestrzennym w testach robotycznych
Agenci AI OpenAI przeprowadzili cyberatak na RubyGems, tworząc ponad 2000 pakietów
Google prezentuje TimesFM-3: nowy model AI do prognozowania przyszłości na podstawie danych sprzedażowych i pogodowych
Samodoskonalenie AI nie doprowadzi do nagłej eksplozji inteligencji, ale niesie ryzyko
Mecka AI blisko wyceny 500 milionów dolarów w rundzie prowadzonej przez Sequoia, w obliczu popytu na dane do szkolenia r
Newsy

Mecka AI blisko wyceny 500 milionów dolarów w rundzie prowadzonej przez Sequoia, w obliczu popytu na dane do szkolenia r

Startup Mecka AI, specjalizujący się w zbieraniu danych o ruchu człowieka do szkolenia robotów, zbliża się do nowej rundy finansowania prowadzonej przez Sequoia Capital, która może wycenić firmę na około 500 milionów dol

Redakcja Aigest22 godz. temu

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.