IBM Research prezentuje ALTK-Evolve: Mniej tokenów, ta sama skuteczność w uczeniu agentów AI
IBM Research przedstawia ALTK-Evolve, nową metodę uczenia agentów AI, która oferuje porównywalną lub lepszą dokładność niż konkurencyjne systemy, jednocześnie znacznie redukując koszty tokenów.

Modele sztucznej inteligencji, zwłaszcza agenci LLM, często napotykają trudności w niezawodnym stosowaniu swojej wiedzy w złożonych, wieloetapowych zadaniach. Problem nie leży w braku informacji, lecz w internalizacji sposobu ich użycia. Rozwiązaniem jest uczenie agentów na podstawie ich własnych doświadczeń, czyli tzw. pamięć agentowa.
ALTK-Evolve kontra ACE: Dwa podejścia do pamięci agentowej
Dwa systemy, ACE (Agentic Context Engineering) oraz ALTK-Evolve od IBM Research, podchodzą do tego problemu, umożliwiając agentom uczenie się z własnych trajektorii. Oba systemy przekształcają przeszłe działania agenta w lekcje, które są następnie wykorzystywane podczas wnioskowania, bez konieczności aktualizacji wag modelu czy ręcznego etykietowania danych. Kluczowa różnica między nimi leży w sposobie dostarczania tych lekcji, co bezpośrednio wpływa na koszt tokenów.
Zarówno ACE, jak i ALTK-Evolve zgadzają się co do jednego: nie należy kompresować zdobytej przez agenta wiedzy. ACE precyzyjnie identyfikuje tryby awarii, takie jak "tendencja do zwięzłości" (brevity bias) i "załamanie kontekstu" (context collapse), i odpowiada na nie, utrzymując bogaty, uszczegółowiony "playbook" z licznikami pomocności/szkodliwości dla każdego punktu. Model destyluje istotne informacje w momencie odczytu.
IBM Research dochodzi do podobnego wniosku, ale z innej perspektywy. Każda wyodrębniona wskazówka w ALTK-Evolve posiada licznik wsparcia, wskazujący, ile niezależnych epizodów ją wygenerowało. System nie podsumowuje zbioru do kilku reguł, uznając, że lekcja odkryta w pięciu różnych zadaniach jest inna niż ta, która pojawiła się tylko raz, i obie są wartościowe. Oba systemy odrzucają więc kompresję, skupiając się na zliczaniu, a nie spłaszczaniu doświadczeń.
Różnice w budowaniu i dostarczaniu pamięci
Rozbieżności między systemami pojawiają się w dwóch obszarach: sposobie budowania pamięci oraz sposobie jej dostarczania do modelu. To właśnie dostarczanie ma największy wpływ na koszt tokenów.
Budowanie pamięci (konsolidacja):
- ACE rozwija jeden, kompleksowy playbook poprzez pętlę Generator → Reflektor → Kurator, stosując przyrostowe aktualizacje i deduplikację za pomocą osadzania (embedding).
- ALTK-Evolve grupuje niemal identyczne lekcje i łączy je w klastrach, zachowując wsparcie. Gdy kilka lekcji się łączy, nowa dziedziczy ich łączną liczbę wsparcia, co zmniejsza rozmiar pamięci bez utraty informacji o doświadczeniu stojącym za każdą wskazówką. ALTK-Evolve ekstrahuje również wskazówki typowane (strategia, odzyskiwanie, optymalizacja) z atrybucją przyczynową i pochodzeniem z trajektorii źródłowej, na poziomie podzadań, co pozwala na przenoszenie lekcji między aplikacjami.
Dostarczanie pamięci (do modelu podczas wnioskowania):
- ACE zawsze wstrzykuje cały kompleksowy playbook na każdym kroku, niezależnie od modelu czy zadania.
- ALTK-Evolve traktuje dostarczanie jako zmienną, a nie stałą. Wysyła mały, stały rdzeń wysoce wspieranych wskazówek, rozszerzany o kilka wybranych dla danego zadania (za pomocą podobieństwa kosinusowego lub z pomocą LLM, z wagami priorytetowymi). W przypadku modeli o większej pojemności, ALTK-Evolve może dostarczyć pełny, skonsolidowany zestaw. Różnica polega na tym, że ACE zawsze wysyła wszystkie lekcje, podczas gdy ALTK-Evolve dostosowuje ich liczbę do możliwości danego modelu.
Wyniki i znaczenie dla kosztów wnioskowania
Testy przeprowadzone na platformie AppWorld z użyciem tego samego agenta bazowego ReAct wykazały znaczące różnice w kosztach i dokładności. Na silniejszym modelu ALTK-Evolve osiągnęło porównywalne metryki przy około 40% kosztów wnioskowania ACE. Na słabszym modelu ALTK-Evolve nieznacznie przewyższyło ACE (56.0 do 54.8), co uznano za remis pod względem dokładności, ale przy około jednej siódmej kosztów.
Klucz do oszczędności tokenów leży w dostarczaniu. Zamiast wstrzykiwać cały playbook na każdym kroku, ALTK-Evolve pobiera tylko kilka wskazówek na zadanie. Analiza dokładności według trudności zadań ujawnia, że na modelu gpt-oss-120b pełny playbook ACE miał przewagę w zadaniach łatwych i średnich. Jednak w zadaniach trudnych, gdzie model musiał wybrać właściwą lekcję, a nie przeglądać wszystkie, selektywne pobieranie ALTK-Evolve okazało się skuteczniejsze i decydowało o wynikach ogólnych. Na modelu DeepSeek-V3.2 ALTK-Evolve wygrało w zadaniach łatwych, trudnych i ogólnych, co sugeruje, że silniejsze modele lepiej wykorzystują dostarczane w ten sposób lekcje, bez wzajemnego zakłócania się.
IBM Research podkreśla, że każdemu modelowi przypisano najlepszą konfigurację: pełny skonsolidowany zestaw dla modelu silnego i selektywne pobieranie dla słabszego, ponieważ duży kontekst może przytłoczyć słabszy model, zamiast mu pomóc.
Podsumowanie i dalsze kroki
Zarówno ALTK-Evolve, jak i ACE, odrzucają kompresję doświadczeń agenta, zgadzając się, że lekcje powinny być zliczane, a nie spłaszczane. Różnica polega na tym, czy dostarczanie tych lekcji jest stałe, czy kalibrowane. ACE zawsze wysyła cały playbook, podczas gdy ALTK-Evolve dostosowuje ilość dostarczanych wskazówek do możliwości danego modelu. Ta kalibracja pozwoliła osiągnąć taką samą lub lepszą dokładność przy ułamku kosztów wnioskowania ACE, a w przypadku słabszych modeli, była to różnica między pomocnym a przeszkadzającym prowadzeniem. IBM Research udostępnia bibliotekę ALTK-Evolve, zawierającą potok ekstrakcji, konsolidacji i pobierania, oraz pełny raport techniczny dla zainteresowanych szczegółami metody. Rozwój takich systemów jest kluczowy dla efektywnego i ekonomicznego wdrażania agentów AI w praktycznych zastosowaniach, gdzie koszt tokenów stanowi istotną barierę.
Źródło: huggingface.co
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Nvidia gwarantuje wartość chipów, by utrzymać dynamikę rozwoju AI
Nvidia wchodzi w nową rolę gwaranta finansowego, aby odblokować 500 miliardów dolarów na infrastrukturę AI. To strategiczny ruch, który wskazuje na dojrzałość rynku, ale i na jego potencjalne ryzyka.
Michał Chmielarz5 godz. temu

NVIDIA prezentuje Nemotron 3.5 Lightning i NeMo Switchyard dla efektywniejszych agentów AI
NVIDIA wprowadza Nemotron 3.5 Lightning, lekki model AI do zadań agentowych, oraz NeMo Switchyard, bibliotekę do inteligentnego routingu zapytań, mające na celu obniżenie kosztów i opóźnień w działaniu agentów AI.
Redakcja Aigest6 godz. temu



Brad Lightcap, wieloletni COO OpenAI, odchodzi, aby „rozpocząć coś nowego”
Brad Lightcap, jeden z najdłużej pracujących menedżerów w OpenAI, ogłosił swoje odejście z firmy, aby zająć się nowymi przedsięwzięciami, co wpisuje się w szersze zmiany kadrowe w spółce.
Redakcja Aigest19 godz. temu

Ujawniono wrażliwość w API wiodących modeli AI: wyciek haseł i wgląd w ukryte procesy myślowe
Badacze bezpieczeństwa odkryli lukę w API wszystkich głównych dostawców AI, która pozwala na odczytywanie zaszyfrowanych procesów myślowych modeli, prowadząc do wycieku danych uwierzytelniających i ujawniając nieoczekiwa
Redakcja Aigest19 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.