FreeToken: Przełomowy silnik MoE uruchamia 753B GLM-5.2 na pojedynczej karcie graficznej
Nowy silnik FreeToken, opracowany przez badaczy z UC Berkeley i UT Austin, umożliwia uruchamianie zaawansowanych modeli językowych, takich jak 753B GLM-5.2, na pojedynczych, konsumenckich kartach graficznych, znacząco ob

Modele open-source, takie jak Kimi-K3, GLM-5.2 czy DeepSeek-V4-Flash, szybko zbliżają się możliwościami do systemów własnościowych. Jednak ich uruchamianie nadal wymagało kosztownych klastrów GPU klasy centrów danych, co stanowiło barierę dla indywidualnych deweloperów i małych zespołów. Problem ten rozwiązuje FreeToken, innowacyjny silnik inferencyjny opracowany przez zespół badaczy z UC Berkeley i UT Austin. System ten traktuje komputer osobisty jako zunifikowaną, elastyczną platformę inferencyjną, optymalizując wykorzystanie dostępnych zasobów GPU, CPU, pamięci i przepustowości. Dzięki temu możliwe jest uruchomienie modelu 35B z interaktywną prędkością na laptopie z 8 GB GPU, modelu 284B na komputerze gamingowym, a nawet 753B GLM-5.2 na pojedynczej karcie graficznej stacji roboczej.
FreeToken w praktyce i jego zastosowania
FreeToken jest dostępny na GitHubie na licencji Apache-2.0, opublikowany w PyPI jako freetoken v0.1.2, a także jako aplikacja desktopowa typu „one-click” dla systemów Windows i Linux na stronie flashml.ai. Narzędzie CLI (interfejs wiersza poleceń) jest przeznaczone dla systemów Linux x86_64 z kartą graficzną NVIDIA i sterownikiem r580+ (CUDA 13). ft serve udostępnia punkty końcowe kompatybilne z OpenAI i Anthropic na porcie 1919, a ft launch claude pozwala na podłączenie modeli takich jak Claude Code, Codex, OpenCode czy OpenClaw do lokalnego urządzenia.
FreeToken jest idealnym rozwiązaniem dla:
- Samodzielnych deweloperów, startupów i zespołów inżynierskich z sektora MŚP, których rachunki za tokeny agentów przekraczają koszt posiadanej karty graficznej.
- Przedsiębiorstw, które mogą go wykorzystać do zadań wymagających izolacji danych (air-gapped) lub regulowanych obciążeń, nie jako zamiennik centrum danych.
Najsilniejsze zastosowanie znajduje w branżach takich jak opieka zdrowotna i prawo (gdzie dane nigdy nie opuszczają maszyny), obrona, finanse oraz badania i rozwój z dużą ilością własności intelektualnej. Typowe aplikacje obejmują lokalne agenty kodujące, prywatne przeglądy kodu, analizę umów offline, generowanie danych syntetycznych i ewaluacje wsadowe.
Architektura Mixture-of-Experts i wydajność FreeToken
Kluczem do lokalnej inferencji modeli klasy frontier jest architektura Mixture-of-Experts (MoE). Przykładowo, model DeepSeek-V4-Flash aktywuje tylko 6 z 256 ekspertów w każdej z 43 warstw, co oznacza, że w przetwarzaniu pojedynczego tokena uczestniczy jedynie 13B z jego 284B parametrów. Chociaż rzadkość (sparsity) nie zmniejsza puli ekspertów – w formacie FP4 pełny zestaw zajmuje około 140 GB – nieaktywni eksperci są przechowywani w pamięci hosta i ładowani do ścieżki wykonawczej tylko na żądanie.
Badacze zidentyfikowali trzy główne niedoskonałości w istniejących silnikach, takich jak llama.cpp, KTransformers i Ollama. FreeToken znacząco przewyższa je pod względem wydajności:
- Na karcie RTX 5090, FreeToken osiąga 77–83 tok/s dla Qwen3.6-35B-A3B (BF16) i 22–25 tok/s dla DeepSeek-V4-Flash (MXFP4), co stanowi 1.5–2.3-krotność najlepszych wyników konkurencji.
- Czas do pierwszego tokena (TTFT) w najgorszym przypadku nie przekracza 44 sekund, podczas gdy llama.cpp osiąga 232 s, Ollama 179 s, a KTransformers nawet 946 s, co często prowadzi do przekroczenia limitu czasu przez klientów agentów.
- Przy tej samej pojemności pamięci podręcznej (37% puli Qwen3.6), globalny algorytm LRU w FreeToken generuje 16% błędów odczytu ekspertów podczas dekodowania, w porównaniu do 41% dla KTransformers i 62% dla llama.cpp.
- Na laptopie z 8 GB RTX 4060, wersja NVFP4 obsługuje model 35B z prędkością 39.3 tok/s, przewyższając medianę 33 tok/s dla Codexa w śladach produkcyjnych.
- Na pojedynczej karcie RTX PRO 6000, GLM-5.2 (753B, 40B aktywnych) działa z prędkością 14.9 tok/s, podczas gdy llama.cpp osiąga 7.3 tok/s.
Szersze konsekwencje dla rozwoju AI
Wprowadzenie FreeToken zmienia zasady gry w dziedzinie inferencji dużych modeli językowych, demokratyzując dostęp do zaawansowanych możliwości AI. Umożliwienie uruchamiania potężnych modeli na sprzęcie konsumenckim otwiera drzwi dla innowacji poza środowiskiem centrów danych, wspierając rozwój lokalnych agentów AI, prywatnych narzędzi analitycznych i aplikacji wymagających wysokiej poufności danych. To znaczący krok w kierunku decentralizacji AI, który może przyspieszyć adopcję i rozwój technologii w wielu sektorach, jednocześnie redukując koszty i zwiększając bezpieczeństwo danych. Warto obserwować, jak ta technologia wpłynie na dalszy rozwój i dostępność sztucznej inteligencji dla szerokiego grona użytkowników i firm.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Dlaczego teksty generowane przez AI są wykrywalne? Bradley Emi wskazuje na "mode collapse"
Bradley Emi z Pangramu twierdzi, że choć LLM-y mogłyby pisać różnorodnie jak ludzie, to post-treningowe zabezpieczenia sprawiają, że ich teksty są łatwo wykrywalne. Zjawisko to nazywa „mode collapse”.
Redakcja Aigest3 dni temu

Kompleksowy przewodnik po dostrajaniu modeli LLM do wywoływania narzędzi z XYZ-Aquila-SFT i Qwen3
Artykuł przedstawia szczegółowy przewodnik po dostrajaniu dużych modeli językowych (LLM) do efektywnego wykorzystywania narzędzi, bazując na zbiorze danych XYZ-Aquila-SFT i modelu Qwen3-0.6B.
Redakcja Aigest15 sie 2026

Anthropic wykorzystuje swój najpotężniejszy model Claude Mythos 5 do cyberobrony
Anthropic wdraża swój zaawansowany model Claude Mythos 5 w narzędziach do cyberbezpieczeństwa, w tym w skanerze kodów i produktach partnerskich, aby wzmocnić obronę przed cyberzagrożeniami.
Redakcja Aigest2 dni temu

Starcloud pozyskuje 250 mln dolarów na orbitalne centra danych, mimo kurczących się możliwości startowych
Firma Starcloud, rozwijająca satelity do wnioskowania AI na orbicie, pozyskała dodatkowe 250 milionów dolarów finansowania, co zwiększa jej wycenę do 2,3 miliarda dolarów. Inwestycja ma umożliwić rozbudowę infrastruktury
Redakcja Aigest2 dni temu


Micro1 osiąga 500 mln dolarów rocznego przychodu brutto dzięki boomowi na dane treningowe dla AI
Startup Micro1, specjalizujący się w danych dla sztucznej inteligencji, odnotował znaczący wzrost, osiągając 500 milionów dolarów rocznego przychodu brutto w ciągu ośmiu miesięcy, co świadczy o ogromnym zapotrzebowaniu n
Redakcja Aigest2 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.