Aigest.
Newsy

GLM-5.3-Flash i Qwen3.8-Flash-Next: Chińskie laboratoria AI niezależnie tworzą podobne architektury

Dwa czołowe chińskie laboratoria AI, Z.ai i Alibaba, niezależnie opracowały nowe modele językowe GLM-5.3-Flash i Qwen3.8-Flash-Next, które wykazują zaskakująco zbieżne rozwiązania architektoniczne.

RA

Udostępnij
GLM-5.3-Flash i Qwen3.8-Flash-Next: Chińskie laboratoria AI niezależnie tworzą podobne architektury
Fot. MarkTechPost

W ostatnim czasie na rynku otwartych modeli sztucznej inteligencji pojawiły się dwie znaczące nowości z Chin. Firma Z.ai zaprezentowała GLM-5.3-Flash, multimodalny model MoE z 320 miliardami parametrów, z czego 18 miliardów jest aktywnych. Niemal równocześnie zespół Qwen z Alibaby udostępnił Qwen3.8-Flash-Next, model o 125 miliardach parametrów (6 miliardów aktywnych), który stanowi zapowiedź architektury Qwen4. Co intrygujące, oba zespoły, pracując niezależnie, doszły do bardzo podobnych rozwiązań architektonicznych.

Zbieżne podejścia w projektowaniu modeli

Analiza konfiguracji obu modeli ujawnia uderzające podobieństwa. Zarówno GLM-5.3-Flash, jak i Qwen3.8-Flash-Next, wykorzystują hybrydowe podejście do uwagi, łącząc uwagę liniową i pełną w proporcji 3:1. Oba modele stosują również skompresowany indeksator do wyboru kontekstu, ograniczony do 2048 tokenów. Kolejnym wspólnym elementem jest rozszerzenie strumienia rezydualnego na cztery bramkowane gałęzie. Co więcej, oba systemy są trenowane za pomocą optymalizatora Muon, z połączonymi macierzami parametrów dzielonymi przed ortogonalizacją.

GLM-5.3-Flash: multimodalność i wydajność

GLM-5.3-Flash to pierwszy natywnie multimodalny model z serii GLM-5, udostępniony na Hugging Face na licencji MIT. Model ten, testowany anonimowo jako Ox Alpha na platformie OpenRouter, szybko zdobył popularność. Został wytrenowany na multimodalnym korpusie danych o wielkości 30 bilionów tokenów i obsługuje okno kontekstowe o rozmiarze 1 miliona tokenów. Z.ai twierdzi, że GLM-5.3-Flash przewyższa GLM-5.2 w testach porównawczych, będąc jednocześnie dziesięciokrotnie tańszym w użyciu. Jego wydajność w zadaniach kodowania i agentowych ma zbliżać się do Claude Opus 4.8. Ceny za korzystanie z modelu wynoszą 0,15 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych.

Qwen3.8-Flash-Next: zapowiedź przyszłości

Qwen3.8-Flash-Next pełni rolę podobną do tej, jaką Qwen3-Next odegrał dla Qwen3.5, stanowiąc wczesny publiczny podgląd kolejnej generacji architektury. Karta modelu wskazuje na główny model 125B parametrów, uzupełniony o dodatkową tabelę osadzeń n-gramów o wielkości 51B, z 6B parametrów aktywowanych na token. Natywne okno kontekstowe wynosi 262 144 tokeny, z możliwością rozszerzenia do 1 miliona tokenów za pomocą techniki YaRN. Zespół Qwen informuje, że trening modelu wymagał około jednej dziewiątej mocy obliczeniowej w porównaniu do Qwen3.7-Plus. Towarzyszący raport techniczny nosi tytuł „On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability”.

Szczegóły architektoniczne i wspólne innowacje

Oba modele stosują innowacyjne rozwiązania w zakresie uwagi i przetwarzania kontekstu:

  • Warstwy uwagi: GLM-5.3-Flash składa się z 45 warstw (34 liniowych i 11 pełnych), natomiast Qwen3.8-Flash-Next z 48 warstw (w powtarzającym się bloku 3 warstw Gated DeltaNet i 1 warstwy Qwen Sparse Attention). Oba osiągają proporcję 3:1 między uwagą liniową a pełną.
  • Uwaga liniowa: Warstwy liniowe, które są tańsze obliczeniowo, kompresują całą historię w stan rekurencyjny o stałym rozmiarze. GLM wykorzystuje Kimi Delta Attention (KDA), natomiast Qwen własny Gated DeltaNet (GDN). Mimo różnic w granularności bramkowania, oba mechanizmy pełnią tę samą funkcję.
  • Selekcja kontekstu: Żaden z modeli nie pozwala warstwom pełnej uwagi na przetwarzanie całego kontekstu. Oba wykorzystują mały, nauczony indeksator, który ocenia fragmenty historii i zachowuje tylko te najbardziej istotne. GLM używa indeksatora lightning indexer z selekcją top-2048, a Qwen indeksatora, który wybiera top 512 bloków 4-tokenowych, co również daje 2048 tokenów. Oba modele kompresują kontekst czterokrotnie przed oceną.
  • Rozszerzony strumień rezydualny: Oba modele odchodzą od pojedynczego strumienia rezydualnego, rozszerzając go na cztery równoległe gałęzie z bramkami kontrolującymi przepływ danych. GLM adaptuje Manifold-Constrained Hyper-Connections (mHC), a Qwen opracował własny wariant Gated Residual.
  • Optymalizator: Oba modele trenowane są z użyciem optymalizatora Muon, z identycznym udoskonaleniem polegającym na dzieleniu połączonych macierzy projekcji przed ortogonalizacją.

Jedna rozbieżność: osadzenia pozycji obrotowej (RoPE)

Jedynym wyraźnym punktem rozbieżności jest zastosowanie obrotowych osadzeń pozycji (RoPE) w warstwach pełnej uwagi. GLM-5.3-Flash całkowicie je pomija, polegając na niejawnej informacji pozycyjnej przepływającej przez rekurencyjne warstwy liniowe. Z kolei Qwen, po eksperymentach, zdecydował się na zachowanie RoPE. Testy Qwen wykazały, że choć brak RoPE nie wpływał na pre-trening, to po post-treningu wariant bez RoPE często nie potrafił zakończyć generowania tekstu, co stanowi ważną lekcję dla całej branży.

Konwergencja i dysonans w branży

Opisane rozwiązania nie są ograniczone tylko do tych dwóch laboratoriów. DeepSeek był pionierem wzorca indeksatora rzadkiego z budżetem 2048 tokenów w DeepSeek-V3.2-Exp, a mHC to również ich projekt. Moonshot AI z modelem Kimi przyczynił się do powstania KDA, warstwy uwagi liniowej przyjętej przez GLM. Widać wyraźne zapylanie krzyżowe komponentów architektonicznych i konwergencję na wspólnych ustawieniach wśród chińskich modeli open-source.

Jednakże, nie wszyscy podążają tą drogą. MiniMax, podczas rozwoju modelu M2, intensywnie testował uwagę liniową i przesuwną, stwierdzając poważne deficyty w rozumowaniu wieloetapowym, zwłaszcza powyżej 32 tys. tokenów kontekstu po SFT. M2 został wydany z pełną uwagą softmax w każdej warstwie. Dla M3, MiniMax przyjął MiniMax Sparse Attention (MSA), która rzadkuje uwagę softmax poprzez selekcję bloków, ale nie zawiera żadnych warstw uwagi liniowej. To pokazuje, że choć wielu gigantów AI zmierza w podobnym kierunku, branża nie osiągnęła jeszcze pełnej zgody co do optymalnej architektury, a debata na temat najlepszych metod przetwarzania długich kontekstów i zachowania zdolności rozumowania pozostaje otwarta.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

AQuA: Nowatorski system AI do autonomicznego odkrywania czynników i rozwoju modeli w finansach ilościowych
Anthropic prezentuje samodoskonalącą się sztuczną inteligencję
Thomson Reuters inwestuje 40 milionów dolarów w rozwój własnego modelu AI „Thomson”
CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.