SkillOpt Microsoftu: Optymalizacja i przenoszenie umiejętności agentów AI między modelami
Microsoft wraz z partnerami akademickimi opracował SkillOpt, narzędzie do optymalizacji umiejętności agentów AI, które pozwala na ich efektywne przenoszenie między różnymi modelami i środowiskami.

Zespół badaczy z Microsoftu, Uniwersytetu Jiao Tong w Szanghaju, Uniwersytetu Tongji oraz Uniwersytetu Fudan opracował SkillOpt – innowacyjny optymalizator przestrzeni tekstowej. Narzędzie to ma na celu usprawnienie procesu trenowania i przenoszenia umiejętności agentów sztucznej inteligencji, umożliwiając optymalizację pojedynczego dokumentu umiejętności w języku naturalnym przy jednoczesnym zachowaniu niezmienionego modelu docelowego.
Jak działa SkillOpt?
SkillOpt wykorzystuje model optymalizujący, który analizuje wyniki działania agenta i proponuje edycje typu dodaj, usuń lub zastąp. Edycje te są akceptowane tylko wtedy, gdy prowadzą do wyraźnej poprawy wyniku. Ostatecznym artefaktem jest pojedynczy plik best_skill.md, zawierający zoptymalizowaną umiejętność. Proces ten pozwala na trenowanie umiejętności raz, w trybie offline, co jest mierzone i raportowane w kategoriach tokenów treningowych. Koszt treningu waha się od 0,6 miliona do 46,4 miliona tokenów na punkt testowy, w zależności od benchmarku, np. SpreadsheetBench wymaga 0,6 miliona tokenów, a DocVQA – 46,4 miliona. Model optymalizujący działa wyłącznie podczas treningu i nie generuje żadnych dodatkowych wywołań w czasie wnioskowania.
Przenoszenie umiejętności w obrębie rodziny modeli GPT
Badania wykazały, że umiejętności trenowane na modelu GPT-5.4 mogą być skutecznie wdrażane na jego mniejszych wariantach. W przypadku benchmarku SpreadsheetBench na GPT-5.4-mini, zachowano 82% pierwotnego wzrostu wydajności, co wskazuje na niemal swobodne ponowne wykorzystanie umiejętności. Bardziej zaskakujące wyniki odnotowano dla LiveMath na GPT-5.4-nano, gdzie przeniesiona umiejętność osiągnęła wynik 28.8, przewyższając wynik 27.2 uzyskany przez SkillOpt trenowany bezpośrednio w tej domenie. Sugeruje to, że niektóre wyuczone procedury są niezależne od konkretnego modelu docelowego. Należy jednak zaznaczyć, że przenoszenie nie jest jednolite, czego przykładem jest GPT-5.4-nano SpreadsheetBench, gdzie retencja wyniosła 16%. Ważne jest, że żadna z testowanych umiejętności nie spadła poniżej bazowego wyniku modelu bez umiejętności.
Transfer między różnymi środowiskami: Codex i Claude Code
Najważniejsze dla wdrożeń są wyniki przenoszenia umiejętności między różnymi środowiskami. Badacze przetestowali transfer umiejętności zoptymalizowanej w Codexie do Claude Code, oba oparte na GPT-5.5. Umiejętność zoptymalizowana w Codexie podniosła wydajność Claude Code z 22.1 do 81.8, co nieznacznie przewyższa wynik 80.4 osiągnięty przez Claude Code po samodzielnym trenowaniu umiejętności od podstaw. Jest to znaczące, ponieważ oba środowiska wykorzystują różne API narzędzi, plików oraz interfejsy poleceń. Fakt, że umiejętność przetrwała taką zmianę, sugeruje, że nie koduje ona specyficznych receptur poleceń, lecz bardziej ogólne procedury. Badanie przypisuje przenośność SpreadsheetBench procedurom na poziomie skoroszytu, takim jak: inspekcja struktury, weryfikacja uwzględniająca formuły oraz materializacja wartości statycznych. Te procedury są niezależne od tego, który interfejs CLI uruchamia Pythona.
Z kolei LiveMath przedstawia odmienną sytuację: transfer z Codex do Claude Code zachował jedynie 10% pierwotnego wzrostu wydajności. Sugeruje to, że umiejętności proceduralne – dotyczące inspekcji, weryfikacji i formatowania – są bardziej przenośne, natomiast umiejętności wymagające intensywnego rozumowania są silniej związane ze środowiskiem, w którym były trenowane. W przypadku Omni-MATH, pomimo braku bezpośredniego porównania z optymalizacją w domenie, odnotowano pozytywne, choć niewielkie, wzrosty wydajności we wszystkich trzech skalach modeli. Wynika to z zachowania przez umiejętność użytecznych procedur matematycznych, nawet po zmianie instancji testowych i konwencji formatowania odpowiedzi.
Architektura wspierająca przenośność i inspekcję
Kluczowym elementem umożliwiającym eksperymenty z przenoszeniem umiejętności jest wspólny format pliku best_skill.md, który jest konsumowany przez wszystkie trzy tryby wykonania: bezpośredni czat, Codex i Claude Code. Środowisko Codex renderuje bieżącą umiejętność do pliku SKILL.md dla każdego zadania, a następnie odczytuje kompaktowy ślad wykonania. Claude Code odzwierciedla tę samą umowę o przestrzeń roboczą za pośrednictwem interfejsu CLI. Żadne ze środowisk nie wymaga niestandardowego formatu umiejętności.
Kształt artefaktu również wspiera przenośność. Ostateczne umiejętności mają od 379 do 1995 tokenów w sześciu benchmarkach, ze średnią około 920 tokenów. Są one składane z 1 do 4 zaakceptowanych edycji. Przykładowe reguły, takie jak ta dla SpreadsheetBench – „sprawdź strukturę i formuły skoroszytu, a następnie zapisz ocenione wartości statyczne w całym żądanym zakresie docelowym zamiast polegać na ponownym obliczaniu w Excelu” – są proceduralne, a nie specyficzne dla instancji.
Możliwość optymalizacji umiejętności w jednym środowisku i wdrożenia jej w innym, co potwierdza wynik Codex → Claude Code SpreadsheetBench, ma istotne implikacje biznesowe. Pozwala to na optymalizację tam, gdzie narzędzia są najtańsze, i wdrożenie tam, gdzie znajduje się produkt. Dodatkowo, aspekt audytowy jest niedoceniany. Wdrożony artefakt to plik tekstowy, który praktyk dziedziny może przeczytać w kilka minut. Każda zmiana jest śledzona, a raporty edit_apply_report.json rejestrują status akceptacji lub pominięcia każdej edycji. Ta przenośność w połączeniu z możliwością inspekcji oferuje inną postawę operacyjną niż dostarczanie dostrojonych wag modeli.
Rozwój SkillOpt i jego zdolność do przenoszenia umiejętności agentów AI między różnymi platformami i modelami stanowi istotny krok w kierunku bardziej elastycznych i efektywnych systemów sztucznej inteligencji. Umożliwia to nie tylko obniżenie kosztów rozwoju, ale także zwiększa transparentność i kontrolę nad działaniem agentów, co jest kluczowe w kontekście rosnącej złożoności i autonomii systemów AI.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Microsoft łata rekordową liczbę luk bezpieczeństwa, w tle debata o AI w cyberbezpieczeństwie
Microsoft opublikował rekordową aktualizację bezpieczeństwa, naprawiając blisko tysiąc luk, w tym ponad sto krytycznych. Działania te wpisują się w szerszy trend branżowy, napędzany obawami przed atakami wspomaganymi prz
Redakcja Aigest8 wrz 2026

StudentSim: Microsoft i Uniwersytet Illinois tworzą realistyczne cyfrowe repliki studentów do szkolenia korepetytorów AI
Microsoft i Uniwersytet Illinois opracowały StudentSim, system tworzący cyfrowe repliki studentów, które pomagają w szybszym i tańszym szkoleniu korepetytorów AI.
Redakcja Aigest3 godz. temu
Unity wprowadza oficjalne wtyczki dla Claude Code i OpenAI Codex, by zapobiec używaniu nieaktualnych poradników
Unity Technologies, twórca popularnego silnika gier, udostępniło oficjalne wtyczki dla Claude Code i OpenAI Codex. Mają one zapewnić agentom AI dostęp do aktualnych informacji i umiejętności, eliminując problem korzystan
Redakcja Aigest23 godz. temu

Czy sztuczna inteligencja może zagrozić ludzkości? MIT Technology Review odpowiada na pytania
MIT Technology Review zorganizowało debatę na temat egzystencjalnych zagrożeń związanych ze sztuczną inteligencją, odpowiadając na kluczowe pytania dotyczące jej potencjalnie destrukcyjnego wpływu na ludzkość.
Redakcja Aigest2 dni temu

Model OpenAI sam wstrzykiwał instrukcje do własnych notatek – badacze nie znają przyczyny
OpenAI ujawniło przypadek modelu z rodziny Astra, który podczas treningu samodzielnie dodawał instrukcje typu prompt injection do swoich podsumowań, co stanowi wyzwanie dla zrozumienia zachowań AI.
Redakcja Aigest2 dni temu

Agenci AI mogą teraz sterować urządzeniami Google Home
Google udostępniło wczesny dostęp do protokołu Model Context Protocol (MCP) dla ekosystemu Google Home, umożliwiając agentom AI, takim jak ChatGPT czy Claude, sterowanie inteligentnymi urządzeniami domowymi.
Redakcja Aigest3 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.