Aigest.
Narzędzia AI

AllenAI Open Instruct: Kompaktowe szkolenie Tulu 3 z SFT, DPO i RLVR w środowisku 16 GB

AllenAI zaprezentowało kompleksowy proces post-treningowy dla modelu językowego Tulu 3, dostosowany do ograniczeń pamięciowych 16 GB. Wykorzystano techniki takie jak Supervised Fine-Tuning, Direct Preference Optimization

RA

Udostępnij
AllenAI Open Instruct: Kompaktowe szkolenie Tulu 3 z SFT, DPO i RLVR w środowisku 16 GB
Fot. MarkTechPost

AllenAI przedstawiło szczegółowy przewodnik po procesie post-treningowym dla kompaktowego modelu językowego Tulu 3, dostrojonego do instrukcji. Cały potok został zaprojektowany tak, aby działał efektywnie w środowisku z 16 GB pamięci RAM, co stanowi adaptację oryginalnej konfiguracji Tulu 3 dla wielu procesorów graficznych. Proces ten obejmuje trzy główne etapy szkolenia: Supervised Fine-Tuning (SFT), Direct Preference Optimization (DPO) oraz Reinforcement Learning with Verifiable Rewards (RLVR), wykorzystujący metodę GRPO.

Architektura i adaptacja Open Instruct

Kluczowym elementem rozwiązania jest wykorzystanie frameworku Open Instruct od AllenAI. W ramach projektu sklonowano repozytorium Open Instruct, a następnie selektywnie załadowano jego natywne funkcje strat i narzędziowe. Zaimplementowano również adaptery LoRA (Low-Rank Adaptation), które pozwalają na efektywne dostrajanie modelu. Dane z zestawu GSM8K zostały przygotowane dla każdego etapu szkolenia, a do oceny generowanych odpowiedzi matematycznych zastosowano deterministyczne weryfikatory.

Zachowano podstawową logikę optymalizacji Open Instruct, jednocześnie zastępując rozproszone komponenty, takie jak vLLM, Ray actors, DeepSpeed i asynchroniczne kolejki, lżejszymi implementacjami z bibliotek Hugging Face i PyTorch. Dzięki temu cały system jest odpowiedni do uruchamiania w środowiskach takich jak Google Colab.

Konfiguracja i przygotowanie środowiska

Przed rozpoczęciem szkolenia instalowane są niezbędne, lekkie zależności, klonowane repozytorium Open Instruct i konfigurowane środowisko Colab w celu zapewnienia stabilnego działania. System automatycznie wykrywa dostępny tryb precyzji GPU i wybiera FP16 lub BF16 dla automatycznego rzutowania typów, w zależności od możliwości sprzętowych. Co istotne, oryginalne funkcje DPO, GRPO, maskowania i log-prawdopodobieństwa są wyodrębniane bezpośrednio z repozytorium, bez importowania pełnego stosu rozproszonego szkolenia.

Centralna klasa konfiguracyjna CFG kontroluje wszystkie parametry szkolenia, w tym:

  • Model (Qwen/Qwen2.5-0.5B-Instruct)
  • Maksymalną długość sekwencji (max_seq_len: 640)
  • Rozmiary zestawów danych dla SFT, DPO i RLVR
  • Współczynniki uczenia
  • Ustawienia partii
  • Parametry optymalizacji dla każdego etapu.

Inicjalizowany jest tokenizator Open Instruct, z zachowaniem szablonu czatu modelu i zapewnieniem prawidłowego rozdzielenia tokenów wypełniających i końca sekwencji. Następnie tokenizowana jest przykładowa konwersacja, co pozwala wizualizować, które tokeny asystenta przyczyniają się do nadzorowanej straty treningowej.

Przygotowanie danych i weryfikacja

Zestaw danych GSM8K jest ładowany, a jego pytania i rozwiązania są przekształcane w spójny format konwersacyjny, odpowiedni dla treningu SFT, DPO i RLVR. Tworzone są przykłady nadzorowane, pary preferencji (z celowo nieprawidłowymi odpowiedziami końcowymi) oraz gotowe do weryfikacji podpowiedzi ze strukturalnymi etykietami prawdy podstawowej.

System inicjalizuje weryfikatory Open Instruct dla GSM8K, zadań matematycznych oraz zadań zgodnych z instrukcjami. Są one następnie wykorzystywane do deterministycznego oceniania generowanych odpowiedzi. Przykładowe testy weryfikatorów pokazują ich zdolność do oceny poprawności odpowiedzi w różnych scenariuszach, od prostych sum po złożone wyrażenia matematyczne i zgodność z instrukcjami.

Znaczenie dla rozwoju modeli językowych

Prezentowane podejście AllenAI do post-treningu modelu Tulu 3 w ograniczonym środowisku pamięciowym jest istotnym krokiem w kierunku demokratyzacji dostępu do zaawansowanych technik uczenia maszynowego. Umożliwia ono badaczom i deweloperom z mniejszymi zasobami sprzętowymi eksperymentowanie i rozwijanie modeli językowych, które wcześniej wymagałyby znacznie większej infrastruktury. Integracja różnych metod optymalizacji, takich jak SFT, DPO i RLVR, w spójny i efektywny potok, stanowi cenny wzorzec dla przyszłych projektów w dziedzinie dostrajania modeli AI. To podejście może przyspieszyć innowacje i umożliwić szersze zastosowanie zaawansowanych modeli językowych w praktycznych aplikacjach, nawet na mniej wydajnym sprzęcie.

Źródło: marktechpost.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Baseten dołącza do dostawców inferencji na platformie Hugging Face
Rekordowa liczba laureatów Nagrody Pulitzera ujawniła wykorzystanie AI w swoich pracach
JetBrains udostępnia KotlinLLM: inteligentne makra generujące kod Kotlin w czasie rzeczywistym
Fundamentalna wada sprawia, że duże modele językowe (LLM) są niezwykle podatne na ataki
Indeks Hype'u AI: Nieseksowna strona sztucznej inteligencji
Modele OpenAI zaatakowały Hugging Face – precedens czy powtórka z historii AI?

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.