AllenAI Open Instruct: Kompaktowe szkolenie Tulu 3 z SFT, DPO i RLVR w środowisku 16 GB
AllenAI zaprezentowało kompleksowy proces post-treningowy dla modelu językowego Tulu 3, dostosowany do ograniczeń pamięciowych 16 GB. Wykorzystano techniki takie jak Supervised Fine-Tuning, Direct Preference Optimization

AllenAI przedstawiło szczegółowy przewodnik po procesie post-treningowym dla kompaktowego modelu językowego Tulu 3, dostrojonego do instrukcji. Cały potok został zaprojektowany tak, aby działał efektywnie w środowisku z 16 GB pamięci RAM, co stanowi adaptację oryginalnej konfiguracji Tulu 3 dla wielu procesorów graficznych. Proces ten obejmuje trzy główne etapy szkolenia: Supervised Fine-Tuning (SFT), Direct Preference Optimization (DPO) oraz Reinforcement Learning with Verifiable Rewards (RLVR), wykorzystujący metodę GRPO.
Architektura i adaptacja Open Instruct
Kluczowym elementem rozwiązania jest wykorzystanie frameworku Open Instruct od AllenAI. W ramach projektu sklonowano repozytorium Open Instruct, a następnie selektywnie załadowano jego natywne funkcje strat i narzędziowe. Zaimplementowano również adaptery LoRA (Low-Rank Adaptation), które pozwalają na efektywne dostrajanie modelu. Dane z zestawu GSM8K zostały przygotowane dla każdego etapu szkolenia, a do oceny generowanych odpowiedzi matematycznych zastosowano deterministyczne weryfikatory.
Zachowano podstawową logikę optymalizacji Open Instruct, jednocześnie zastępując rozproszone komponenty, takie jak vLLM, Ray actors, DeepSpeed i asynchroniczne kolejki, lżejszymi implementacjami z bibliotek Hugging Face i PyTorch. Dzięki temu cały system jest odpowiedni do uruchamiania w środowiskach takich jak Google Colab.
Konfiguracja i przygotowanie środowiska
Przed rozpoczęciem szkolenia instalowane są niezbędne, lekkie zależności, klonowane repozytorium Open Instruct i konfigurowane środowisko Colab w celu zapewnienia stabilnego działania. System automatycznie wykrywa dostępny tryb precyzji GPU i wybiera FP16 lub BF16 dla automatycznego rzutowania typów, w zależności od możliwości sprzętowych. Co istotne, oryginalne funkcje DPO, GRPO, maskowania i log-prawdopodobieństwa są wyodrębniane bezpośrednio z repozytorium, bez importowania pełnego stosu rozproszonego szkolenia.
Centralna klasa konfiguracyjna CFG kontroluje wszystkie parametry szkolenia, w tym:
- Model (
Qwen/Qwen2.5-0.5B-Instruct) - Maksymalną długość sekwencji (
max_seq_len: 640) - Rozmiary zestawów danych dla SFT, DPO i RLVR
- Współczynniki uczenia
- Ustawienia partii
- Parametry optymalizacji dla każdego etapu.
Inicjalizowany jest tokenizator Open Instruct, z zachowaniem szablonu czatu modelu i zapewnieniem prawidłowego rozdzielenia tokenów wypełniających i końca sekwencji. Następnie tokenizowana jest przykładowa konwersacja, co pozwala wizualizować, które tokeny asystenta przyczyniają się do nadzorowanej straty treningowej.
Przygotowanie danych i weryfikacja
Zestaw danych GSM8K jest ładowany, a jego pytania i rozwiązania są przekształcane w spójny format konwersacyjny, odpowiedni dla treningu SFT, DPO i RLVR. Tworzone są przykłady nadzorowane, pary preferencji (z celowo nieprawidłowymi odpowiedziami końcowymi) oraz gotowe do weryfikacji podpowiedzi ze strukturalnymi etykietami prawdy podstawowej.
System inicjalizuje weryfikatory Open Instruct dla GSM8K, zadań matematycznych oraz zadań zgodnych z instrukcjami. Są one następnie wykorzystywane do deterministycznego oceniania generowanych odpowiedzi. Przykładowe testy weryfikatorów pokazują ich zdolność do oceny poprawności odpowiedzi w różnych scenariuszach, od prostych sum po złożone wyrażenia matematyczne i zgodność z instrukcjami.
Znaczenie dla rozwoju modeli językowych
Prezentowane podejście AllenAI do post-treningu modelu Tulu 3 w ograniczonym środowisku pamięciowym jest istotnym krokiem w kierunku demokratyzacji dostępu do zaawansowanych technik uczenia maszynowego. Umożliwia ono badaczom i deweloperom z mniejszymi zasobami sprzętowymi eksperymentowanie i rozwijanie modeli językowych, które wcześniej wymagałyby znacznie większej infrastruktury. Integracja różnych metod optymalizacji, takich jak SFT, DPO i RLVR, w spójny i efektywny potok, stanowi cenny wzorzec dla przyszłych projektów w dziedzinie dostrajania modeli AI. To podejście może przyspieszyć innowacje i umożliwić szersze zastosowanie zaawansowanych modeli językowych w praktycznych aplikacjach, nawet na mniej wydajnym sprzęcie.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Baseten dołącza do dostawców inferencji na platformie Hugging Face
Firma Baseten, specjalizująca się w wdrażaniu modeli uczenia maszynowego, stała się nowym dostawcą inferencji na platformie Hugging Face, oferującym skalowalne i efektywne kosztowo rozwiązania.
Redakcja Aigest6 sie 2026

Rekordowa liczba laureatów Nagrody Pulitzera ujawniła wykorzystanie AI w swoich pracach
W tym roku rekordowa liczba ośmiu laureatów Nagrody Pulitzera, w tym pięciu zwycięzców i trzech finalistów, ujawniła wykorzystanie sztucznej inteligencji w swoich zgłoszeniach. Zgłoszenia te, wymagane od 2024 roku, pokaz
Redakcja Aigest4 sie 2026

JetBrains udostępnia KotlinLLM: inteligentne makra generujące kod Kotlin w czasie rzeczywistym
JetBrains Research udostępniło KotlinLLM, wtyczkę do IntelliJ IDEA, która wprowadza inteligentne makra generujące i dynamicznie przeładowujące kod Kotlin w czasie działania aplikacji.
Redakcja Aigest31 lip 2026

Fundamentalna wada sprawia, że duże modele językowe (LLM) są niezwykle podatne na ataki
Badacze odkryli fundamentalną wadę w sposobie działania dużych modeli językowych (LLM), która czyni je podatnymi na ataki. Problem dotyczy identyfikacji źródła instrukcji, co pozwala na manipulowanie modelami w celu uzys
Redakcja Aigest30 lip 2026
Indeks Hype'u AI: Nieseksowna strona sztucznej inteligencji
MIT Technology Review przedstawia subiektywną analizę najnowszych trendów w AI, wskazując na mniej efektowne, lecz istotne aspekty tej technologii.
Redakcja Aigest29 lip 2026

Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.