Kompleksowy przewodnik po dostrajaniu modeli LLM do wywoływania narzędzi z XYZ-Aquila-SFT i Qwen3
Artykuł przedstawia szczegółowy przewodnik po dostrajaniu dużych modeli językowych (LLM) do efektywnego wykorzystywania narzędzi, bazując na zbiorze danych XYZ-Aquila-SFT i modelu Qwen3-0.6B.

W dzisiejszym dynamicznie rozwijającym się świecie sztucznej inteligencji, zdolność dużych modeli językowych (LLM) do skutecznego wywoływania i wykorzystywania zewnętrznych narzędzi staje się kluczowa. Niniejszy artykuł przedstawia szczegółowy przewodnik po nadzorowanym dostrajaniu (SFT) takich modeli, koncentrując się na zbiorze danych XYZ-Aquila-SFT oraz modelu Qwen3-0.6B. Proces ten obejmuje wszystkie etapy – od przygotowania danych, przez konfigurację środowiska, aż po ocenę wytrenowanego modelu.
Przygotowanie i analiza danych
Pierwszym krokiem w procesie dostrajania jest przygotowanie i analiza zbioru danych. W tym przypadku wykorzystano XYZ-Aquila-SFT, który zawiera trajektorie użycia narzędzi. Proces ten obejmuje:
- Strumieniowanie i inspekcję danych: Zbiór danych jest strumieniowany, a jego struktura dokładnie analizowana. Przykładowo, sprawdzane są klucze danych, długość trajektorii oraz sekwencje ról w konwersacji.
- Parsowanie trajektorii wieloetapowego użycia narzędzi: Z treści konwersacji ekstrahowane są ustrukturyzowane wywołania narzędzi, bloki myślowe (
think>) oraz obserwacje (tool_response>). Wykorzystuje się w tym celu wyrażenia regularne i bezpieczne dla zagnieżdżeń skanery JSON. - Analiza charakterystyki korpusu: Po przetworzeniu danych, obliczane są statystyki korpusu, takie jak średnia liczba wywołań narzędzi na trajektorię, głębokość konwersacji (liczba wiadomości) oraz rozkład użycia poszczególnych narzędzi. Wizualizacje tych danych pomagają zrozumieć strukturę i złożoność zbioru.
- Weryfikacja spójności danych: Sprawdzana jest zgodność między liczbą wywołanych narzędzi wykrytych przez parser a wartościami zadeklarowanymi w zbiorze danych, co zapewnia integralność i poprawność analizy.
Konwersja schematów narzędzi i formatowanie ChatML
Kolejnym istotnym etapem jest przygotowanie danych do formatu akceptowanego przez model językowy. Obejmuje to:
- Konwersję schematów narzędzi: Schematy narzędzi, które mogą być osadzone w wiadomościach, są konwertowane między formatem osadzonym w wiadomościach a ustrukturyzowanym. Jest to kluczowe dla prawidłowego interpretowania dostępnych narzędzi przez model.
- Renderowanie ChatML zgodnego z Qwen: Wiadomości konwersacji są formatowane zgodnie ze specyfikacją ChatML, specyficzną dla modelu Qwen3. Istotne jest tutaj ręczne renderowanie, aby zachować wszystkie bloki rozumowania (
think>), które są często pomijane przez standardowe szablony, a są kluczowe dla nadzorowanego uczenia. - Maskowanie strat (loss masking): Podczas renderowania ChatML, stosowane jest maskowanie strat, tak aby model uczył się głównie na odpowiedziach asystenta, ignorując wkład użytkownika. Pozwala to na efektywniejsze skupienie treningu na generowaniu poprawnych wywołań narzędzi i rozumowań.
Konfiguracja treningu i dostrajanie modelu
Po przygotowaniu danych następuje konfiguracja środowiska treningowego i właściwe dostrajanie modelu:
- Konfiguracja środowiska: Ustawiane są parametry treningowe, takie jak identyfikator modelu (Qwen/Qwen3-0.6B), maksymalna długość sekwencji (MAX_SEQ_LEN = 2048), polityka długości (
truncate), liczba kroków treningowych (MAX_STEPS = 30), akumulacja gradientów (GRAD_ACCUM = 8), szybkość uczenia (LR = 1e-4) oraz parametry LoRA (LORA_R = 16). - Zależności i sprzęt: Instalowane są wymagane biblioteki, takie jak Hugging Face Transformers, PEFT i Accelerate. Sprawdzana jest również dostępność procesora graficznego CUDA i wsparcia dla formatu BF16, co jest kluczowe dla wydajnego treningu.
- Tworzenie niestandardowego zbioru danych PyTorch i collatora: Przygotowywane są niestandardowe klasy
DatasetiDataLoaderdla PyTorcha, które efektywnie obsługują przetworzone dane i zapewniają odpowiednie batche do treningu. - Dostrajanie modelu z LoRA: Model Qwen3-0.6B jest dostrajany przy użyciu techniki LoRA (Low-Rank Adaptation), która pozwala na efektywne dostrajanie dużych modeli przy mniejszym zużyciu zasobów obliczeniowych.
Ocena i eksport wyników
Ostatnim etapem jest ocena wydajności modelu i eksport danych do dalszych eksperymentów:
- Ocena predykcji wywołań narzędzi: Model jest oceniany pod kątem jego zdolności do przewidywania wywołań narzędzi zarówno przed, jak i po treningu. Pozwala to na kwantyfikację poprawy wydajności.
- Eksport danych: Przetworzony zbiór danych oraz statystyki korpusu są eksportowane, co umożliwia dalsze analizy i eksperymenty.
Cały ten proces stanowi kompleksowy przewodnik dla każdego, kto chce dostroić modele LLM do specyficznych zadań związanych z wywoływaniem narzędzi. Zastosowanie XYZ-Aquila-SFT w połączeniu z Qwen3-0.6B i technikami takimi jak LoRA otwiera nowe możliwości w tworzeniu bardziej inteligentnych i funkcjonalnych asystentów AI, zdolnych do interakcji ze światem zewnętrznym poprzez API i inne narzędzia. To podejście jest kluczowe dla rozwoju agentów AI, którzy mogą nie tylko rozumieć, ale i działać na podstawie złożonych instrukcji, wykorzystując dostępne zasoby. W miarę jak modele LLM stają się coraz bardziej zaawansowane, ich zdolność do efektywnego używania narzędzi będzie decydować o ich praktycznej użyteczności w wielu dziedzinach.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Zalew książek generowanych przez AI obniża sprzedaż ludzkich autorów na Amazonie
Nowe badanie ujawnia, że książki tworzone przez sztuczną inteligencję zalewają Amazon, prowadząc do spadku przychodów na tytuł, nawet dla dzieł pisanych przez ludzi. Zjawisko to, nazwane „rozrzedzeniem”, ma poważne konse
Redakcja Aigest4 godz. temu

Modele AI nadal słabo radzą sobie z percepcją wizualną, ujawnia nowy benchmark PerceptionBench
Nowy benchmark PerceptionBench, stworzony przez Moonshot AI, ujawnia, że nawet najbardziej zaawansowane multimodalne modele AI osiągają słabe wyniki w zadaniach związanych z percepcją wizualną, niezależnie od zdolności r
Redakcja Aigest10 godz. temu

Google zezwala na usuwanie widocznych znaków wodnych z treści generowanych przez AI
Google ogłosiło zmianę w podejściu do znakowania treści generowanych przez sztuczną inteligencję, umożliwiając użytkownikom usuwanie widocznych znaków wodnych z obrazów, filmów i piosenek, przy jednoczesnym zachowaniu ni
Redakcja Aigest23 godz. temu

Meta udostępnia model AI Glimmer, Zuckerberg apeluje o otwartą sztuczną inteligencję
Meta wypuściła Glimmer, otwarty model AI, jednocześnie Mark Zuckerberg opublikował manifest, w którym opowiada się za demokratyzacją sztucznej inteligencji, choć wizja ta budzi pewne wątpliwości.
Redakcja Aigestwczoraj

Needle 2: Nowy model AI od Cactus Compute do wywoływania narzędzi, działający na urządzeniach mobilnych
Cactus Compute zaprezentował Needle 2, otwarty model AI z 45 milionami parametrów, przeznaczony do wywoływania narzędzi i ekstrakcji danych. Model wyróżnia się niezwykle niskim zapotrzebowaniem na zasoby, działając efekt
Redakcja Aigestwczoraj

Databricks pozyskało 5 miliardów dolarów przy wycenie 190 miliardów, pomimo początkowych planów na mniejszą kwotę
Firma Databricks, specjalizująca się w sztucznej inteligencji i big data, zamknęła rundę finansowania na kwotę 5 miliardów dolarów, osiągając wycenę 190 miliardów dolarów. Początkowo planowano pozyskać jedynie 1 miliard
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.