Aigest.
Newsy

IBM Research prezentuje ALTK-Evolve: Mniej tokenów, ta sama skuteczność w uczeniu agentów AI

IBM Research przedstawia ALTK-Evolve, nową metodę uczenia agentów AI, która oferuje porównywalną lub lepszą dokładność niż konkurencyjne systemy, jednocześnie znacznie redukując koszty tokenów.

RA

Udostępnij
IBM Research prezentuje ALTK-Evolve: Mniej tokenów, ta sama skuteczność w uczeniu agentów AI
Fot. Hugging Face

Modele sztucznej inteligencji, zwłaszcza agenci LLM, często napotykają trudności w niezawodnym stosowaniu swojej wiedzy w złożonych, wieloetapowych zadaniach. Problem nie leży w braku informacji, lecz w internalizacji sposobu ich użycia. Rozwiązaniem jest uczenie agentów na podstawie ich własnych doświadczeń, czyli tzw. pamięć agentowa.

ALTK-Evolve kontra ACE: Dwa podejścia do pamięci agentowej

Dwa systemy, ACE (Agentic Context Engineering) oraz ALTK-Evolve od IBM Research, podchodzą do tego problemu, umożliwiając agentom uczenie się z własnych trajektorii. Oba systemy przekształcają przeszłe działania agenta w lekcje, które są następnie wykorzystywane podczas wnioskowania, bez konieczności aktualizacji wag modelu czy ręcznego etykietowania danych. Kluczowa różnica między nimi leży w sposobie dostarczania tych lekcji, co bezpośrednio wpływa na koszt tokenów.

Zarówno ACE, jak i ALTK-Evolve zgadzają się co do jednego: nie należy kompresować zdobytej przez agenta wiedzy. ACE precyzyjnie identyfikuje tryby awarii, takie jak "tendencja do zwięzłości" (brevity bias) i "załamanie kontekstu" (context collapse), i odpowiada na nie, utrzymując bogaty, uszczegółowiony "playbook" z licznikami pomocności/szkodliwości dla każdego punktu. Model destyluje istotne informacje w momencie odczytu.

IBM Research dochodzi do podobnego wniosku, ale z innej perspektywy. Każda wyodrębniona wskazówka w ALTK-Evolve posiada licznik wsparcia, wskazujący, ile niezależnych epizodów ją wygenerowało. System nie podsumowuje zbioru do kilku reguł, uznając, że lekcja odkryta w pięciu różnych zadaniach jest inna niż ta, która pojawiła się tylko raz, i obie są wartościowe. Oba systemy odrzucają więc kompresję, skupiając się na zliczaniu, a nie spłaszczaniu doświadczeń.

Różnice w budowaniu i dostarczaniu pamięci

Rozbieżności między systemami pojawiają się w dwóch obszarach: sposobie budowania pamięci oraz sposobie jej dostarczania do modelu. To właśnie dostarczanie ma największy wpływ na koszt tokenów.

Budowanie pamięci (konsolidacja):

  • ACE rozwija jeden, kompleksowy playbook poprzez pętlę Generator → Reflektor → Kurator, stosując przyrostowe aktualizacje i deduplikację za pomocą osadzania (embedding).
  • ALTK-Evolve grupuje niemal identyczne lekcje i łączy je w klastrach, zachowując wsparcie. Gdy kilka lekcji się łączy, nowa dziedziczy ich łączną liczbę wsparcia, co zmniejsza rozmiar pamięci bez utraty informacji o doświadczeniu stojącym za każdą wskazówką. ALTK-Evolve ekstrahuje również wskazówki typowane (strategia, odzyskiwanie, optymalizacja) z atrybucją przyczynową i pochodzeniem z trajektorii źródłowej, na poziomie podzadań, co pozwala na przenoszenie lekcji między aplikacjami.

Dostarczanie pamięci (do modelu podczas wnioskowania):

  • ACE zawsze wstrzykuje cały kompleksowy playbook na każdym kroku, niezależnie od modelu czy zadania.
  • ALTK-Evolve traktuje dostarczanie jako zmienną, a nie stałą. Wysyła mały, stały rdzeń wysoce wspieranych wskazówek, rozszerzany o kilka wybranych dla danego zadania (za pomocą podobieństwa kosinusowego lub z pomocą LLM, z wagami priorytetowymi). W przypadku modeli o większej pojemności, ALTK-Evolve może dostarczyć pełny, skonsolidowany zestaw. Różnica polega na tym, że ACE zawsze wysyła wszystkie lekcje, podczas gdy ALTK-Evolve dostosowuje ich liczbę do możliwości danego modelu.

Wyniki i znaczenie dla kosztów wnioskowania

Testy przeprowadzone na platformie AppWorld z użyciem tego samego agenta bazowego ReAct wykazały znaczące różnice w kosztach i dokładności. Na silniejszym modelu ALTK-Evolve osiągnęło porównywalne metryki przy około 40% kosztów wnioskowania ACE. Na słabszym modelu ALTK-Evolve nieznacznie przewyższyło ACE (56.0 do 54.8), co uznano za remis pod względem dokładności, ale przy około jednej siódmej kosztów.

Klucz do oszczędności tokenów leży w dostarczaniu. Zamiast wstrzykiwać cały playbook na każdym kroku, ALTK-Evolve pobiera tylko kilka wskazówek na zadanie. Analiza dokładności według trudności zadań ujawnia, że na modelu gpt-oss-120b pełny playbook ACE miał przewagę w zadaniach łatwych i średnich. Jednak w zadaniach trudnych, gdzie model musiał wybrać właściwą lekcję, a nie przeglądać wszystkie, selektywne pobieranie ALTK-Evolve okazało się skuteczniejsze i decydowało o wynikach ogólnych. Na modelu DeepSeek-V3.2 ALTK-Evolve wygrało w zadaniach łatwych, trudnych i ogólnych, co sugeruje, że silniejsze modele lepiej wykorzystują dostarczane w ten sposób lekcje, bez wzajemnego zakłócania się.

IBM Research podkreśla, że każdemu modelowi przypisano najlepszą konfigurację: pełny skonsolidowany zestaw dla modelu silnego i selektywne pobieranie dla słabszego, ponieważ duży kontekst może przytłoczyć słabszy model, zamiast mu pomóc.

Podsumowanie i dalsze kroki

Zarówno ALTK-Evolve, jak i ACE, odrzucają kompresję doświadczeń agenta, zgadzając się, że lekcje powinny być zliczane, a nie spłaszczane. Różnica polega na tym, czy dostarczanie tych lekcji jest stałe, czy kalibrowane. ACE zawsze wysyła cały playbook, podczas gdy ALTK-Evolve dostosowuje ilość dostarczanych wskazówek do możliwości danego modelu. Ta kalibracja pozwoliła osiągnąć taką samą lub lepszą dokładność przy ułamku kosztów wnioskowania ACE, a w przypadku słabszych modeli, była to różnica między pomocnym a przeszkadzającym prowadzeniem. IBM Research udostępnia bibliotekę ALTK-Evolve, zawierającą potok ekstrakcji, konsolidacji i pobierania, oraz pełny raport techniczny dla zainteresowanych szczegółami metody. Rozwój takich systemów jest kluczowy dla efektywnego i ekonomicznego wdrażania agentów AI w praktycznych zastosowaniach, gdzie koszt tokenów stanowi istotną barierę.

Źródło: huggingface.co

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Nvidia gwarantuje wartość chipów, by utrzymać dynamikę rozwoju AI
NVIDIA prezentuje Nemotron 3.5 Lightning i NeMo Switchyard dla efektywniejszych agentów AI
Newsy

NVIDIA prezentuje Nemotron 3.5 Lightning i NeMo Switchyard dla efektywniejszych agentów AI

NVIDIA wprowadza Nemotron 3.5 Lightning, lekki model AI do zadań agentowych, oraz NeMo Switchyard, bibliotekę do inteligentnego routingu zapytań, mające na celu obniżenie kosztów i opóźnień w działaniu agentów AI.

Redakcja Aigest6 godz. temu

Xiaomi MiLM Plus wprowadza PROVE: Nowe metryki i benchmark do oceny usuwania obiektów z wideo
Aplikacja Gemini Google'a przekroczyła miliard użytkowników
Brad Lightcap, wieloletni COO OpenAI, odchodzi, aby „rozpocząć coś nowego”
Newsy

Brad Lightcap, wieloletni COO OpenAI, odchodzi, aby „rozpocząć coś nowego”

Brad Lightcap, jeden z najdłużej pracujących menedżerów w OpenAI, ogłosił swoje odejście z firmy, aby zająć się nowymi przedsięwzięciami, co wpisuje się w szersze zmiany kadrowe w spółce.

Redakcja Aigest19 godz. temu

Ujawniono wrażliwość w API wiodących modeli AI: wyciek haseł i wgląd w ukryte procesy myślowe
Newsy

Ujawniono wrażliwość w API wiodących modeli AI: wyciek haseł i wgląd w ukryte procesy myślowe

Badacze bezpieczeństwa odkryli lukę w API wszystkich głównych dostawców AI, która pozwala na odczytywanie zaszyfrowanych procesów myślowych modeli, prowadząc do wycieku danych uwierzytelniających i ujawniając nieoczekiwa

Redakcja Aigest19 godz. temu

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.