Aigest.
Newsy

FreeToken: Przełomowy silnik MoE uruchamia 753B GLM-5.2 na pojedynczej karcie graficznej

Nowy silnik FreeToken, opracowany przez badaczy z UC Berkeley i UT Austin, umożliwia uruchamianie zaawansowanych modeli językowych, takich jak 753B GLM-5.2, na pojedynczych, konsumenckich kartach graficznych, znacząco ob

RA

Udostępnij
FreeToken: Przełomowy silnik MoE uruchamia 753B GLM-5.2 na pojedynczej karcie graficznej
Fot. MarkTechPost

Modele open-source, takie jak Kimi-K3, GLM-5.2 czy DeepSeek-V4-Flash, szybko zbliżają się możliwościami do systemów własnościowych. Jednak ich uruchamianie nadal wymagało kosztownych klastrów GPU klasy centrów danych, co stanowiło barierę dla indywidualnych deweloperów i małych zespołów. Problem ten rozwiązuje FreeToken, innowacyjny silnik inferencyjny opracowany przez zespół badaczy z UC Berkeley i UT Austin. System ten traktuje komputer osobisty jako zunifikowaną, elastyczną platformę inferencyjną, optymalizując wykorzystanie dostępnych zasobów GPU, CPU, pamięci i przepustowości. Dzięki temu możliwe jest uruchomienie modelu 35B z interaktywną prędkością na laptopie z 8 GB GPU, modelu 284B na komputerze gamingowym, a nawet 753B GLM-5.2 na pojedynczej karcie graficznej stacji roboczej.

FreeToken w praktyce i jego zastosowania

FreeToken jest dostępny na GitHubie na licencji Apache-2.0, opublikowany w PyPI jako freetoken v0.1.2, a także jako aplikacja desktopowa typu „one-click” dla systemów Windows i Linux na stronie flashml.ai. Narzędzie CLI (interfejs wiersza poleceń) jest przeznaczone dla systemów Linux x86_64 z kartą graficzną NVIDIA i sterownikiem r580+ (CUDA 13). ft serve udostępnia punkty końcowe kompatybilne z OpenAI i Anthropic na porcie 1919, a ft launch claude pozwala na podłączenie modeli takich jak Claude Code, Codex, OpenCode czy OpenClaw do lokalnego urządzenia.

FreeToken jest idealnym rozwiązaniem dla:

  • Samodzielnych deweloperów, startupów i zespołów inżynierskich z sektora MŚP, których rachunki za tokeny agentów przekraczają koszt posiadanej karty graficznej.
  • Przedsiębiorstw, które mogą go wykorzystać do zadań wymagających izolacji danych (air-gapped) lub regulowanych obciążeń, nie jako zamiennik centrum danych.

Najsilniejsze zastosowanie znajduje w branżach takich jak opieka zdrowotna i prawo (gdzie dane nigdy nie opuszczają maszyny), obrona, finanse oraz badania i rozwój z dużą ilością własności intelektualnej. Typowe aplikacje obejmują lokalne agenty kodujące, prywatne przeglądy kodu, analizę umów offline, generowanie danych syntetycznych i ewaluacje wsadowe.

Architektura Mixture-of-Experts i wydajność FreeToken

Kluczem do lokalnej inferencji modeli klasy frontier jest architektura Mixture-of-Experts (MoE). Przykładowo, model DeepSeek-V4-Flash aktywuje tylko 6 z 256 ekspertów w każdej z 43 warstw, co oznacza, że w przetwarzaniu pojedynczego tokena uczestniczy jedynie 13B z jego 284B parametrów. Chociaż rzadkość (sparsity) nie zmniejsza puli ekspertów – w formacie FP4 pełny zestaw zajmuje około 140 GB – nieaktywni eksperci są przechowywani w pamięci hosta i ładowani do ścieżki wykonawczej tylko na żądanie.

Badacze zidentyfikowali trzy główne niedoskonałości w istniejących silnikach, takich jak llama.cpp, KTransformers i Ollama. FreeToken znacząco przewyższa je pod względem wydajności:

  • Na karcie RTX 5090, FreeToken osiąga 77–83 tok/s dla Qwen3.6-35B-A3B (BF16) i 22–25 tok/s dla DeepSeek-V4-Flash (MXFP4), co stanowi 1.5–2.3-krotność najlepszych wyników konkurencji.
  • Czas do pierwszego tokena (TTFT) w najgorszym przypadku nie przekracza 44 sekund, podczas gdy llama.cpp osiąga 232 s, Ollama 179 s, a KTransformers nawet 946 s, co często prowadzi do przekroczenia limitu czasu przez klientów agentów.
  • Przy tej samej pojemności pamięci podręcznej (37% puli Qwen3.6), globalny algorytm LRU w FreeToken generuje 16% błędów odczytu ekspertów podczas dekodowania, w porównaniu do 41% dla KTransformers i 62% dla llama.cpp.
  • Na laptopie z 8 GB RTX 4060, wersja NVFP4 obsługuje model 35B z prędkością 39.3 tok/s, przewyższając medianę 33 tok/s dla Codexa w śladach produkcyjnych.
  • Na pojedynczej karcie RTX PRO 6000, GLM-5.2 (753B, 40B aktywnych) działa z prędkością 14.9 tok/s, podczas gdy llama.cpp osiąga 7.3 tok/s.

Szersze konsekwencje dla rozwoju AI

Wprowadzenie FreeToken zmienia zasady gry w dziedzinie inferencji dużych modeli językowych, demokratyzując dostęp do zaawansowanych możliwości AI. Umożliwienie uruchamiania potężnych modeli na sprzęcie konsumenckim otwiera drzwi dla innowacji poza środowiskiem centrów danych, wspierając rozwój lokalnych agentów AI, prywatnych narzędzi analitycznych i aplikacji wymagających wysokiej poufności danych. To znaczący krok w kierunku decentralizacji AI, który może przyspieszyć adopcję i rozwój technologii w wielu sektorach, jednocześnie redukując koszty i zwiększając bezpieczeństwo danych. Warto obserwować, jak ta technologia wpłynie na dalszy rozwój i dostępność sztucznej inteligencji dla szerokiego grona użytkowników i firm.

Źródło: marktechpost.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Dlaczego teksty generowane przez AI są wykrywalne? Bradley Emi wskazuje na "mode collapse"
Kompleksowy przewodnik po dostrajaniu modeli LLM do wywoływania narzędzi z XYZ-Aquila-SFT i Qwen3
Anthropic wykorzystuje swój najpotężniejszy model Claude Mythos 5 do cyberobrony
Starcloud pozyskuje 250 mln dolarów na orbitalne centra danych, mimo kurczących się możliwości startowych
Meta wydaje setki milionów dolarów rocznie na usługi AI Microsoftu
Micro1 osiąga 500 mln dolarów rocznego przychodu brutto dzięki boomowi na dane treningowe dla AI

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.