Tencent udostępnia AngelSpec: ujednolicony framework do trenowania modeli MTP i blokowo-równoległego dekodowania spekula
Tencent udostępnił AngelSpec, framework do trenowania modeli draftowych dla dekodowania spekulacyjnego, wspierający zarówno predykcję wielotokenową (MTP), jak i rodzinę DFlash.

Tencent udostępnił AngelSpec, otwarty framework do trenowania modeli draftowych dla dekodowania spekulacyjnego, natywny dla PyTorcha. Rozwiązanie to obejmuje zarówno autoregresywną predykcję wielotokenową (MTP), jak i blokowo-równoległą rodzinę DFlash.
Większość dotychczasowych prac nad dekodowaniem spekulacyjnym koncentrowała się na znalezieniu jednego "draftera" (modelu generującego wstępne propozycje), który dobrze radziłby sobie ze średnią mieszanką benchmarków. Jednak rzeczywisty ruch serwerowy nie odzwierciedla takiej mieszanki. AngelSpec traktuje heterogeniczność obciążenia jako kluczowe ograniczenie projektowe, specjalizując strukturę, dane treningowe i głębokość weryfikacji pod kątem konkretnych zastosowań.
Jak działa dekodowanie spekulacyjne i AngelSpec
Dekodowanie spekulacyjne jest metodą bezstratną. Lekki model draftowy proponuje kilka przyszłych tokenów, a model docelowy weryfikuje je jednocześnie w jednym przejściu do przodu, wykorzystując próbkowanie odrzuceniowe. Przyspieszenie zależy od dwóch czynników: liczby zaakceptowanych tokenów draftowych oraz czasu trwania pełnej rundy draft–weryfikacja.
Te dwie wartości zmieniają się w przeciwnych kierunkach w zależności od domeny. W otwartych konwersacjach o wysokiej entropii wiele kontynuacji jest semantycznie poprawnych. Model docelowy może wybrać dowolną z nich, więc akceptacja szybko maleje wraz z głębokością propozycji. Generowanie i weryfikacja długiego bloku marnuje zasoby obliczeniowe. Autoregresywne draftowanie MTP pasuje do tego reżimu, ponieważ proponuje krótszą sekwencję kandydatów.
Kod i rozumowanie matematyczne zachowują się inaczej. Składnia programowania, powtarzające się identyfikatory, formalne wyrażenia i wyprowadzenia krok po kroku silniej ograniczają przyszłe tokeny. Te obciążenia tworzą dłuższe, przewidywalne fragmenty, co doskonale amortyzuje blokowo-równoległe draftowanie.
Z tego powodu AngelSpec dostarcza dwa uzupełniające się modele draftowe, a nie jeden kompromisowy. Model MTP jest trenowany na bogatych, zróżnicowanych danych zorientowanych na konwersacje. Model blokowo-dyfuzyjny jest wzmacniany próbkami skoncentrowanymi na kodzie i matematyce.
Oryginalny model Hy3 jest trenowany z pojedynczą warstwą MTP i bez rekurencyjnego, samokondycjonującego rozwijania. Podczas wnioskowania blok może być ponownie użyty rekurencyjnie, ale cel treningowy nigdy nie przygotował go na długi, samodzielnie generowany łańcuch. Błędy kumulują się wraz z głębokością, więc druga i trzecia pozycja draftu są akceptowane ze znacznie niższymi wskaźnikami niż pierwsza.
AngelSpec rozwiązuje tę niezgodność między treningiem a wnioskowaniem za pomocą schematu wielogłębokościowego ze współdzielonymi parametrami. Zachowuje on D logicznych głębokości predykcji, ale ponownie wykorzystuje jeden fizyczny blok MTP. Podczas treningu ten blok jest autoregresywnie rozwijany przez D kroków, a każda predykcja jest podawana do następnego wywołania. Zgodnie z zasadą Training-Time Test z EAGLE-3, głębokość k+1 otrzymuje predykcję arg max z głębokości k zamiast tokenu rzeczywistego. Parametry są współdzielone, ale nadzór pozostaje specyficzny dla głębokości: cel nauczyciela przesuwa się o jedną przyszłą pozycję na każdej głębokości.
Dwa dalsze wybory przynoszą większość korzyści:
- Zamrożenie rdzenia modelu docelowego i głowy modelu językowego: Wejścia MTP z rdzenia są odłączane. Drafter poprawia swoją dystrybucję propozycji bez dotykania dystrybucji, którą weryfikacja musi zachować.
- Wykorzystanie generowania odpowiedzi przez model docelowy (target-model rollout): Odpowiedzi są generowane przez zamrożony model docelowy, a nie pobierane z oryginalnego korpusu referencyjnego. To generuje dokładne wybory tokenów, trajektorie ukrytych stanów i lokalne wzorce niepewności, które MTP musi aproksymować w czasie serwowania.
Zmierzony efekt jest skoncentrowany tam, gdzie powinien. Przy T = 0 średnia akceptacja wzrasta z 52,8% do 66,4%, a średnia zaakceptowana długość z 2,58 do 2,99. Wskaźnik dla pierwszej pozycji jest prawie zachowany (0,799 → 0,814). Głębsze pozycje niosą zmianę: p3 wzrasta z 0,290 do 0,706 na GSM8K i z 0,387 do 0,757 na HumanEval.
Architektura DFly i jej wydajność
DFly to architektura blokowo-dyfuzyjna, która bazuje na DFlash z dwoma zmianami strukturalnymi:
- Hybrydowy rdzeń warunkujący cel: DFlash łączy ukryte stany z wielu warstw docelowych i przekształca je za pomocą w pełni połączonej warstwy, tworząc jedną wspólną cechę kontekstu. Ten pojedynczy kontekst jest następnie dostarczany do każdej warstwy draftowej, co ogranicza specjalizację warstw. DFlare uczy się wag fuzji dla każdej warstwy, dając każdej warstwie draftowej własny widok hierarchii docelowej, ale pomija nauczoną transformację międzywarstwową DFlash. DFly je łączy: gałąź FC ustanawia wspólną podstawę semantyczną, a fuzja dla każdej warstwy jest stosowana jako resztkowe udoskonalenie. Dodatkowa gałąź wprowadza tylko D × T skalarnych wag, a jej współczynniki softmax mogą być wstępnie obliczone po treningu.
- Głowa autoregresywna warunkowana poprzednikiem: Równoległy rdzeń przewiduje każdą pozycję bloku tylko z zaakceptowanego kontekstu. Nie może zobaczyć, która kontynuacja została faktycznie wybrana na wcześniejszych pozycjach draftu, co prowadzi do spadku akceptacji sufiksu. DFly umieszcza małą sekwencyjną głowę po równoległym rdzeniu, konwertując marginalne predykcje pozycyjne na rozkłady warunkowane prefiksem. Drogi rdzeń pozostaje w pełni równoległy; tylko mała głowa działa od lewej do prawej.
Na modelu Qwen3-8B, DFly osiąga średnią zaakceptowaną długość 5,41, w porównaniu do 5,32 dla DSpark, 4,57 dla DFlash i 3,24 dla MTP. Osiąga najlepsze wyniki we wszystkich pięciu benchmarkach matematycznych i kodowych. DSpark pozostaje nieco z przodu na MT-Bench (3,77 kontra 3,67), co jest zgodne z pozycjonowaniem DFly dla kodu i matematyki.
Na Hy3-A21B marża jest szersza. DFly osiąga 4,79 w porównaniu do 3,69 dla DFlash i 3,00 dla MTP — względne zyski odpowiednio 29,8% i 59,7%. Poprawia każdy z sześciu zgłoszonych benchmarków.
Kumulatywna ablacjacja na Hy3-A21B w trybie dekodowania zachłannego wskazuje, skąd pochodzą te wyniki: rdzeń DFlash 3,77, rdzeń DFly 4,40, plus głowa Markova 4,56, korekcja ukryta 4,60 i dane kodowe/matematyczne 4,75. Rozszerzenie danych dodaje 700 tysięcy promptów — 500 tysięcy kodu z OpenCodeInstruct i OpenCodeReasoning, 200 tysięcy matematyki z Big-Math. Wszelkie prompty współdzielące ciągły 16-tokenowy fragment z przykładem ewaluacyjnym są usuwane przed generowaniem odpowiedzi.
AngelSpec jest zbudowany na TorchSpec i rozszerza go w kilku miejscach. Fundament jest rozdzielony: silniki wnioskowania uruchamiają zamrożony model docelowy i przesyłają ukryte stany przez magazyn RDMA wspierany przez Mooncake bezpośrednio do rozproszonych workerów treningowych. Ukryte stany są przechwytywane w procesach workerów vLLM poprzez publiczne API vLLM — hak do ekstrakcji spekulacyjnych ukrytych stanów i niestandardowy konektor KV — bez forkowania silnika.
Backendy są warstwowe: vLLM jest pierwszorzędny, a SGLang i HuggingFace Transformers są wspierane na poziomie społeczności. Całość badań jest zasługą naukowców zaangażowanych w ten projekt.
Udostępnienie AngelSpec przez Tencent stanowi znaczący krok w optymalizacji wydajności dużych modeli językowych, szczególnie w kontekście zróżnicowanych zastosowań. Podkreśla to rosnące znaczenie specjalizacji narzędzi AI, które coraz lepiej adaptują się do specyfiki konkretnych zadań, od otwartych konwersacji po złożone rozumowanie matematyczne i generowanie kodu. Rozwiązania takie jak AngelSpec, zwiększając efektywność dekodowania spekulacyjnego, mogą przyczynić się do szybszego i bardziej ekonomicznego wdrażania zaawansowanych modeli AI w praktycznych zastosowaniach.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Alibaba prezentuje Qwen 3.8: nowy model AI z 2,4 biliona parametrów, konkurencja dla Kimi K3
Alibaba wprowadza Qwen 3.8, swój najnowszy model AI o otwartym kodzie, który ma konkurować z czołowymi rozwiązaniami na rynku, w tym z Kimi K3.
Redakcja Aigest19 lip 2026

Algorytm HAWK wycofany po ataku AI Mythos Anthropic
Kandydat na standard kryptografii postkwantowej HAWK został wycofany po tym, jak model AI Mythos firmy Anthropic odkrył w nim krytyczną lukę, która znacząco osłabiła jego bezpieczeństwo.
Redakcja Aigest16 godz. temu

Claude Opus 5 bezwzględnym kapitalistą w symulacji biznesu automatów vendingowych
Firma Andon Labs przetestowała modele AI w symulacji prowadzenia automatów vendingowych, gdzie Claude Opus 5 wykazał się bezwzględnymi taktykami biznesowymi, bijąc rekordy zysków.
Redakcja Aigest19 godz. temu

PwC Bliski Wschód oskarżone o publikowanie raportów generowanych przez AI z fałszywymi źródłami
Firma PwC Bliski Wschód znalazła się w ogniu krytyki po tym, jak narzędzie GPTZero wykryło fałszywe źródła i nieprawdziwe twierdzenia w jej raportach, sugerując wykorzystanie sztucznej inteligencji do ich tworzenia.
Redakcja Aigest20 godz. temu
Indeks Hype'u AI: Nieseksowna strona sztucznej inteligencji
MIT Technology Review przedstawia subiektywną analizę najnowszych trendów w AI, wskazując na mniej efektowne, lecz istotne aspekty tej technologii.
Redakcja Aigestwczoraj

Model AI Anthropic, Mythos, odkrył luki w algorytmach kryptograficznych
Model AI Claude Mythos Preview firmy Anthropic zidentyfikował matematyczne słabości w algorytmach kryptograficznych, które stanowią podstawę bezpieczeństwa cyfrowego, w tym w schemacie postkwantowym HAWK i zredukowanej w
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.