SkillOpt Microsoftu: Optymalizacja i przenoszenie umiejętności agentów AI między modelami
Microsoft wraz z partnerami akademickimi opracował SkillOpt, narzędzie do optymalizacji umiejętności agentów AI, które pozwala na ich efektywne przenoszenie między różnymi modelami i środowiskami.

Zespół badaczy z Microsoftu, Uniwersytetu Jiao Tong w Szanghaju, Uniwersytetu Tongji oraz Uniwersytetu Fudan opracował SkillOpt – innowacyjny optymalizator przestrzeni tekstowej. Narzędzie to ma na celu usprawnienie procesu trenowania i przenoszenia umiejętności agentów sztucznej inteligencji, umożliwiając optymalizację pojedynczego dokumentu umiejętności w języku naturalnym przy jednoczesnym zachowaniu niezmienionego modelu docelowego.
Jak działa SkillOpt?
SkillOpt wykorzystuje model optymalizujący, który analizuje wyniki działania agenta i proponuje edycje typu dodaj, usuń lub zastąp. Edycje te są akceptowane tylko wtedy, gdy prowadzą do wyraźnej poprawy wyniku. Ostatecznym artefaktem jest pojedynczy plik best_skill.md, zawierający zoptymalizowaną umiejętność. Proces ten pozwala na trenowanie umiejętności raz, w trybie offline, co jest mierzone i raportowane w kategoriach tokenów treningowych. Koszt treningu waha się od 0,6 miliona do 46,4 miliona tokenów na punkt testowy, w zależności od benchmarku, np. SpreadsheetBench wymaga 0,6 miliona tokenów, a DocVQA – 46,4 miliona. Model optymalizujący działa wyłącznie podczas treningu i nie generuje żadnych dodatkowych wywołań w czasie wnioskowania.
Przenoszenie umiejętności w obrębie rodziny modeli GPT
Badania wykazały, że umiejętności trenowane na modelu GPT-5.4 mogą być skutecznie wdrażane na jego mniejszych wariantach. W przypadku benchmarku SpreadsheetBench na GPT-5.4-mini, zachowano 82% pierwotnego wzrostu wydajności, co wskazuje na niemal swobodne ponowne wykorzystanie umiejętności. Bardziej zaskakujące wyniki odnotowano dla LiveMath na GPT-5.4-nano, gdzie przeniesiona umiejętność osiągnęła wynik 28.8, przewyższając wynik 27.2 uzyskany przez SkillOpt trenowany bezpośrednio w tej domenie. Sugeruje to, że niektóre wyuczone procedury są niezależne od konkretnego modelu docelowego. Należy jednak zaznaczyć, że przenoszenie nie jest jednolite, czego przykładem jest GPT-5.4-nano SpreadsheetBench, gdzie retencja wyniosła 16%. Ważne jest, że żadna z testowanych umiejętności nie spadła poniżej bazowego wyniku modelu bez umiejętności.
Transfer między różnymi środowiskami: Codex i Claude Code
Najważniejsze dla wdrożeń są wyniki przenoszenia umiejętności między różnymi środowiskami. Badacze przetestowali transfer umiejętności zoptymalizowanej w Codexie do Claude Code, oba oparte na GPT-5.5. Umiejętność zoptymalizowana w Codexie podniosła wydajność Claude Code z 22.1 do 81.8, co nieznacznie przewyższa wynik 80.4 osiągnięty przez Claude Code po samodzielnym trenowaniu umiejętności od podstaw. Jest to znaczące, ponieważ oba środowiska wykorzystują różne API narzędzi, plików oraz interfejsy poleceń. Fakt, że umiejętność przetrwała taką zmianę, sugeruje, że nie koduje ona specyficznych receptur poleceń, lecz bardziej ogólne procedury. Badanie przypisuje przenośność SpreadsheetBench procedurom na poziomie skoroszytu, takim jak: inspekcja struktury, weryfikacja uwzględniająca formuły oraz materializacja wartości statycznych. Te procedury są niezależne od tego, który interfejs CLI uruchamia Pythona.
Z kolei LiveMath przedstawia odmienną sytuację: transfer z Codex do Claude Code zachował jedynie 10% pierwotnego wzrostu wydajności. Sugeruje to, że umiejętności proceduralne – dotyczące inspekcji, weryfikacji i formatowania – są bardziej przenośne, natomiast umiejętności wymagające intensywnego rozumowania są silniej związane ze środowiskiem, w którym były trenowane. W przypadku Omni-MATH, pomimo braku bezpośredniego porównania z optymalizacją w domenie, odnotowano pozytywne, choć niewielkie, wzrosty wydajności we wszystkich trzech skalach modeli. Wynika to z zachowania przez umiejętność użytecznych procedur matematycznych, nawet po zmianie instancji testowych i konwencji formatowania odpowiedzi.
Architektura wspierająca przenośność i inspekcję
Kluczowym elementem umożliwiającym eksperymenty z przenoszeniem umiejętności jest wspólny format pliku best_skill.md, który jest konsumowany przez wszystkie trzy tryby wykonania: bezpośredni czat, Codex i Claude Code. Środowisko Codex renderuje bieżącą umiejętność do pliku SKILL.md dla każdego zadania, a następnie odczytuje kompaktowy ślad wykonania. Claude Code odzwierciedla tę samą umowę o przestrzeń roboczą za pośrednictwem interfejsu CLI. Żadne ze środowisk nie wymaga niestandardowego formatu umiejętności.
Kształt artefaktu również wspiera przenośność. Ostateczne umiejętności mają od 379 do 1995 tokenów w sześciu benchmarkach, ze średnią około 920 tokenów. Są one składane z 1 do 4 zaakceptowanych edycji. Przykładowe reguły, takie jak ta dla SpreadsheetBench – „sprawdź strukturę i formuły skoroszytu, a następnie zapisz ocenione wartości statyczne w całym żądanym zakresie docelowym zamiast polegać na ponownym obliczaniu w Excelu” – są proceduralne, a nie specyficzne dla instancji.
Możliwość optymalizacji umiejętności w jednym środowisku i wdrożenia jej w innym, co potwierdza wynik Codex → Claude Code SpreadsheetBench, ma istotne implikacje biznesowe. Pozwala to na optymalizację tam, gdzie narzędzia są najtańsze, i wdrożenie tam, gdzie znajduje się produkt. Dodatkowo, aspekt audytowy jest niedoceniany. Wdrożony artefakt to plik tekstowy, który praktyk dziedziny może przeczytać w kilka minut. Każda zmiana jest śledzona, a raporty edit_apply_report.json rejestrują status akceptacji lub pominięcia każdej edycji. Ta przenośność w połączeniu z możliwością inspekcji oferuje inną postawę operacyjną niż dostarczanie dostrojonych wag modeli.
Rozwój SkillOpt i jego zdolność do przenoszenia umiejętności agentów AI między różnymi platformami i modelami stanowi istotny krok w kierunku bardziej elastycznych i efektywnych systemów sztucznej inteligencji. Umożliwia to nie tylko obniżenie kosztów rozwoju, ale także zwiększa transparentność i kontrolę nad działaniem agentów, co jest kluczowe w kontekście rosnącej złożoności i autonomii systemów AI.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Shopify: Wyszukiwanie AI zwiększa ruch i sprzedaż, nie zastępując Google
Shopify odnotowuje znaczny wzrost ruchu i sprzedaży dzięki wyszukiwaniu opartemu na sztucznej inteligencji, co stanowi uzupełnienie, a nie substytut tradycyjnych metod wyszukiwania. Firma przypisuje AI część swoich dobry
Redakcja Aigest17 godz. temu

Google finansuje infrastrukturę AI Anthropic za miliardy, minimalizując własne ryzyko
Google, we współpracy z Broadcom, Apollo i Blackstone, stworzyło innowacyjny mechanizm finansowania sprzedaży chipów AI Anthropic, minimalizując jednocześnie własne ryzyko bilansowe. To jedno z największych przedsięwzięć
Redakcja Aigestwczoraj
Spotify rozszerza projekt AI do remiksów i coverów dzięki partnerstwu z Merlinem
Spotify ogłosiło rozszerzenie swojego projektu AI umożliwiającego tworzenie remiksów i coverów muzycznych, dołączając do współpracy Merlin, globalną sieć niezależnych wytwórni i dystrybutorów.
Redakcja Aigestwczoraj

Runware wprowadza modułowe centra danych Sonic Inference Pod, stawiając na rozproszoną infrastrukturę AI
Firma Runware zaprezentowała Sonic Inference Pod – modułowe, przenośne centrum danych, które ma oferować wysokiej jakości wnioskowanie AI przy niższych kosztach. Rozwiązanie to ma być elastyczną alternatywą dla tradycyjn
Redakcja Aigestwczoraj

Ukraińskie drony kamikadze zyskują zdolność autonomicznego śledzenia celów dzięki amerykańskiej AI
Amerykańska firma Auterion dostarcza Ukrainie systemy AI, które pozwalają dronom Shrike autonomicznie śledzić i uderzać w ruchome cele, nawet bez sygnału GPS. To znaczące usprawnienie dla tanich dronów kamikadze.
Redakcja Aigest2 dni temu

58 000 studentów musi powtórzyć egzamin UNAM nadzorowany przez AI z powodu masowych oszustw
Egzamin wstępny na największy meksykański uniwersytet, nadzorowany zdalnie przez sztuczną inteligencję, zakończył się skandalem. Nienaturalnie wysokie wyniki doprowadziły do konieczności powtórzenia testu przez dziesiątk
Redakcja Aigest2 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.