VibeThinker-3B: Mały model językowy Sina rywalizuje z gigantami w logice, ale nie w wiedzy
Chiński model językowy VibeThinker-3B, opracowany przez firmę Sina, osiąga wyniki porównywalne z modelami stukrotnie większymi w zadaniach matematycznych i programistycznych, co podważa dotychczasowe założenia dotyczące

Chiński model językowy VibeThinker-3B, opracowany przez firmę Sina (właściciela Weibo), zaskakuje swoimi osiągnięciami. Pomimo posiadania zaledwie trzech miliardów parametrów, w niektórych zadaniach matematycznych i programistycznych dorównuje modelom stukrotnie większym. Odkrycia te prowadzą badaczy do nowej hipotezy dotyczącej struktury zdolności sztucznej inteligencji.
Przełom w zadaniach logicznych
Według raportu technicznego, VibeThinker-3B osiąga wyniki porównywalne z DeepSeek V3.2 i Kimi K2.5 w wymagających benchmarkach, takich jak AIME26. Co istotne, oba te modele mają od 200 do 333 razy więcej parametrów. Sina traktuje ten model jako eksperyment mający na celu ustalenie, ile mocy obliczeniowej faktycznie potrzebuje model, aby konkurować na najwyższym poziomie. Poprzednik, VibeThinker-1.5B, został wprowadzony w listopadzie 2025 roku, a nowa wersja ma sprawdzić, czy mały model może osiągnąć prawdziwie topową wydajność, a nie tylko być „dobry jak na swój rozmiar”.
Wyniki są dwojakie. W zadaniach strukturalnych z jasno weryfikowalnymi rozwiązaniami, takich jak olimpiady matematyczne czy wyzwania programistyczne, VibeThinker-3B dorównuje modelom takim jak GLM-5 czy Gemini 3 Pro. W benchmarku LiveCodeBench przewyższa wszystkie inne modele poniżej 20 miliardów parametrów.
Aby wykluczyć zanieczyszczenie danych, zespół przetestował model w konkursach LeetCode odbywających się między końcem kwietnia a końcem maja 2026 roku, już po zakończeniu szkolenia. VibeThinker-3B rozwiązał 123 ze 128 problemów za pierwszym podejściem. To stawia go przed GPT-5.2, Qwen3-Max, Kimi K2.5 i Claude Opus 4.6. Ustępuje jedynie GPT-5.3-Codex, Gemini 3.1 Pro i Gemini 3 Flash, ale z niewielką różnicą.
Ograniczenia w wiedzy faktograficznej
Sytuacja wygląda inaczej w przypadku wiedzy faktograficznej. W benchmarku GPQA-Diamond, który kładzie nacisk na wiedzę, model znacznie ustępuje swoim większym konkurentom. To wskazuje, że zdolność do logicznego rozumowania i rozwiązywania problemów może być efektywnie skompresowana, ale przechowywanie obszernej wiedzy faktograficznej wymaga większej liczby parametrów.
Metodologia szkolenia i hipoteza badaczy
VibeThinker-3B bazuje na modelu Qwen2.5-Coder-3B firmy Alibaba. Kluczowy wkład Sina to post-szkolenie, czyli wszystko, co dzieje się po ogólnym wstępnym szkoleniu na dużych zbiorach danych. Według raportu, to właśnie ten etap sprawia, że model 3B zbliża się do najlepszych wyników.
Post-szkolenie odbywa się etapami:
- Nadzorowane dostrajanie (supervised fine-tuning): Model uczy się szerokiego zakresu zadań, w tym matematyki, kodowania i ogólnego dialogu.
- Dostosowanie do złożonych problemów: Następnie model jest specjalnie dostosowywany do trudnych, wieloetapowych problemów rozumowania.
- Uczenie ze wzmocnieniem (reinforcement learning): Stosowane sekwencyjnie dla matematyki, programowania i STEM.
- Samodestylowanie (self-distillation): Konsoliduje umiejętności z każdej fazy w jeden model.
- Końcowy etap: Zapewnia lepsze przestrzeganie instrukcji przez model.
Podczas dostrajania zespół celowo buduje szeroką gamę ścieżek rozwiązań, a uczenie ze wzmocnieniem wzmacnia te, które działają. Argumentuje się, że wydajność wynika z metod szkolenia, jakości danych i wiarygodnych sygnałów walidacyjnych, a nie z większej liczby parametrów.
Na podstawie tych wyników autorzy proponują „Hipotezę Kompresji-Pokrycia Parametrycznego”. Zakłada ona, że różne zdolności AI mają różne struktury i wymagają różnej liczby parametrów. Rozumowanie logiczne, takie jak rozwiązywanie problemów matematycznych krok po kroku, opiera się na kilku powtarzających się wzorcach (wyszukiwanie, sprawdzanie warunków, korygowanie błędów, łączenie wyników pośrednich). Tego rodzaju umiejętności można skompresować w kompaktowy rdzeń. Wiedza o świecie działa inaczej; odpowiadanie na otwarte pytania z wielu dziedzin wymaga szerokiego pokrycia, co oznacza wiele parametrów przechowujących wiele faktów.
Nowe perspektywy dla małych modeli
Badacze podkreślają, że to odkrycie zmienia postrzeganie małych modeli. Nie są one już tylko tańszymi, lżejszymi wersjami przeznaczonymi do budżetowego wnioskowania, ale stanowią niezależną ścieżkę badawczą, równoległą do tradycyjnej logiki skalowania. Tam, gdzie zadania są weryfikowalne i mają jasne struktury rozwiązań, liczba parametrów przestaje być wąskim gardłem. VibeThinker-3B jest publicznie dostępny na platformach Hugging Face i GitHub.
Trend, w którym małe modele dorównują znacznie większym systemom w wąskich zadaniach, staje się coraz bardziej widoczny. W kwietniu Qwen3.6-27B firmy Alibaba przewyższył swojego 15-krotnie większego poprzednika we wszystkich benchmarkach kodowania. Falcon H1R 7B z Abu Zabi osiągnął poziom wydajności modeli dwu- do siedmiokrotnie większych. Wyniki VibeThinker w zadaniach weryfikowalnych podważają wcześniejsze założenia, że małe modele napotykają ogólnie na trudności w rozumowaniu wieloetapowym, otwierając nowe możliwości dla efektywniejszego rozwoju AI.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej


Anthropic może osiągnąć wycenę 2 bilionów dolarów podczas debiutu giełdowego
Inwestorzy Anthropic, twórcy modelu Claude, przewidują, że startup AI może osiągnąć wycenę 2 bilionów dolarów lub więcej podczas planowanego debiutu giełdowego jesienią, co uczyniłoby go największą ofertą publiczną w his
Redakcja Aigest9 godz. temu

Agenci AI stają się kluczowym kierunkiem rozwoju i wyceny w branży
Wycena Cognition na 40 miliardów dolarów oraz nowe narzędzia od NVIDII i SpaceXAI pokazują, że agenci AI to nie tylko technologiczna nowinka, ale realny motor wzrostu i innowacji.
Michał Chmielarz15 godz. temu

SpaceXAI prezentuje Grok 4.6: model z kontekstem 500 tys. tokenów dla agentów AI i programistów
SpaceXAI udostępniło Grok 4.6, ulepszoną wersję swojego modelu AI, która oferuje znacznie większy kontekst i lepszą wydajność w zadaniach wymagających długotrwałego działania agentów oraz w pracy z kodem.
Redakcja Aigest17 godz. temu

Niewidzialne znaki wodne w Claude budzą kontrowersje wśród użytkowników
Anthropic wprowadziło niewidzialne znaki wodne do treści generowanych przez chatbota Claude, co wywołało niezadowolenie części użytkowników obawiających się wykrycia użycia AI w pracy czy na uczelni.
Redakcja Aigestwczoraj

Twitch domyślnie wykorzysta treści streamerów do trenowania AI Amazona, budząc sprzeciw
Platforma Twitch, należąca do Amazona, będzie domyślnie używać materiałów twórców do szkolenia generatywnych modeli AI, co wywołało falę krytyki w społeczności streamerów. Użytkownicy muszą ręcznie wyłączyć tę opcję.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.