GLM-5.3-Flash i Qwen3.8-Flash-Next: Chińskie laboratoria AI niezależnie tworzą podobne architektury
Dwa czołowe chińskie laboratoria AI, Z.ai i Alibaba, niezależnie opracowały nowe modele językowe GLM-5.3-Flash i Qwen3.8-Flash-Next, które wykazują zaskakująco zbieżne rozwiązania architektoniczne.

W ostatnim czasie na rynku otwartych modeli sztucznej inteligencji pojawiły się dwie znaczące nowości z Chin. Firma Z.ai zaprezentowała GLM-5.3-Flash, multimodalny model MoE z 320 miliardami parametrów, z czego 18 miliardów jest aktywnych. Niemal równocześnie zespół Qwen z Alibaby udostępnił Qwen3.8-Flash-Next, model o 125 miliardach parametrów (6 miliardów aktywnych), który stanowi zapowiedź architektury Qwen4. Co intrygujące, oba zespoły, pracując niezależnie, doszły do bardzo podobnych rozwiązań architektonicznych.
Zbieżne podejścia w projektowaniu modeli
Analiza konfiguracji obu modeli ujawnia uderzające podobieństwa. Zarówno GLM-5.3-Flash, jak i Qwen3.8-Flash-Next, wykorzystują hybrydowe podejście do uwagi, łącząc uwagę liniową i pełną w proporcji 3:1. Oba modele stosują również skompresowany indeksator do wyboru kontekstu, ograniczony do 2048 tokenów. Kolejnym wspólnym elementem jest rozszerzenie strumienia rezydualnego na cztery bramkowane gałęzie. Co więcej, oba systemy są trenowane za pomocą optymalizatora Muon, z połączonymi macierzami parametrów dzielonymi przed ortogonalizacją.
GLM-5.3-Flash: multimodalność i wydajność
GLM-5.3-Flash to pierwszy natywnie multimodalny model z serii GLM-5, udostępniony na Hugging Face na licencji MIT. Model ten, testowany anonimowo jako Ox Alpha na platformie OpenRouter, szybko zdobył popularność. Został wytrenowany na multimodalnym korpusie danych o wielkości 30 bilionów tokenów i obsługuje okno kontekstowe o rozmiarze 1 miliona tokenów. Z.ai twierdzi, że GLM-5.3-Flash przewyższa GLM-5.2 w testach porównawczych, będąc jednocześnie dziesięciokrotnie tańszym w użyciu. Jego wydajność w zadaniach kodowania i agentowych ma zbliżać się do Claude Opus 4.8. Ceny za korzystanie z modelu wynoszą 0,15 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych.
Qwen3.8-Flash-Next: zapowiedź przyszłości
Qwen3.8-Flash-Next pełni rolę podobną do tej, jaką Qwen3-Next odegrał dla Qwen3.5, stanowiąc wczesny publiczny podgląd kolejnej generacji architektury. Karta modelu wskazuje na główny model 125B parametrów, uzupełniony o dodatkową tabelę osadzeń n-gramów o wielkości 51B, z 6B parametrów aktywowanych na token. Natywne okno kontekstowe wynosi 262 144 tokeny, z możliwością rozszerzenia do 1 miliona tokenów za pomocą techniki YaRN. Zespół Qwen informuje, że trening modelu wymagał około jednej dziewiątej mocy obliczeniowej w porównaniu do Qwen3.7-Plus. Towarzyszący raport techniczny nosi tytuł „On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability”.
Szczegóły architektoniczne i wspólne innowacje
Oba modele stosują innowacyjne rozwiązania w zakresie uwagi i przetwarzania kontekstu:
- Warstwy uwagi: GLM-5.3-Flash składa się z 45 warstw (34 liniowych i 11 pełnych), natomiast Qwen3.8-Flash-Next z 48 warstw (w powtarzającym się bloku 3 warstw Gated DeltaNet i 1 warstwy Qwen Sparse Attention). Oba osiągają proporcję 3:1 między uwagą liniową a pełną.
- Uwaga liniowa: Warstwy liniowe, które są tańsze obliczeniowo, kompresują całą historię w stan rekurencyjny o stałym rozmiarze. GLM wykorzystuje Kimi Delta Attention (KDA), natomiast Qwen własny Gated DeltaNet (GDN). Mimo różnic w granularności bramkowania, oba mechanizmy pełnią tę samą funkcję.
- Selekcja kontekstu: Żaden z modeli nie pozwala warstwom pełnej uwagi na przetwarzanie całego kontekstu. Oba wykorzystują mały, nauczony indeksator, który ocenia fragmenty historii i zachowuje tylko te najbardziej istotne. GLM używa indeksatora lightning indexer z selekcją top-2048, a Qwen indeksatora, który wybiera top 512 bloków 4-tokenowych, co również daje 2048 tokenów. Oba modele kompresują kontekst czterokrotnie przed oceną.
- Rozszerzony strumień rezydualny: Oba modele odchodzą od pojedynczego strumienia rezydualnego, rozszerzając go na cztery równoległe gałęzie z bramkami kontrolującymi przepływ danych. GLM adaptuje Manifold-Constrained Hyper-Connections (mHC), a Qwen opracował własny wariant Gated Residual.
- Optymalizator: Oba modele trenowane są z użyciem optymalizatora Muon, z identycznym udoskonaleniem polegającym na dzieleniu połączonych macierzy projekcji przed ortogonalizacją.
Jedna rozbieżność: osadzenia pozycji obrotowej (RoPE)
Jedynym wyraźnym punktem rozbieżności jest zastosowanie obrotowych osadzeń pozycji (RoPE) w warstwach pełnej uwagi. GLM-5.3-Flash całkowicie je pomija, polegając na niejawnej informacji pozycyjnej przepływającej przez rekurencyjne warstwy liniowe. Z kolei Qwen, po eksperymentach, zdecydował się na zachowanie RoPE. Testy Qwen wykazały, że choć brak RoPE nie wpływał na pre-trening, to po post-treningu wariant bez RoPE często nie potrafił zakończyć generowania tekstu, co stanowi ważną lekcję dla całej branży.
Konwergencja i dysonans w branży
Opisane rozwiązania nie są ograniczone tylko do tych dwóch laboratoriów. DeepSeek był pionierem wzorca indeksatora rzadkiego z budżetem 2048 tokenów w DeepSeek-V3.2-Exp, a mHC to również ich projekt. Moonshot AI z modelem Kimi przyczynił się do powstania KDA, warstwy uwagi liniowej przyjętej przez GLM. Widać wyraźne zapylanie krzyżowe komponentów architektonicznych i konwergencję na wspólnych ustawieniach wśród chińskich modeli open-source.
Jednakże, nie wszyscy podążają tą drogą. MiniMax, podczas rozwoju modelu M2, intensywnie testował uwagę liniową i przesuwną, stwierdzając poważne deficyty w rozumowaniu wieloetapowym, zwłaszcza powyżej 32 tys. tokenów kontekstu po SFT. M2 został wydany z pełną uwagą softmax w każdej warstwie. Dla M3, MiniMax przyjął MiniMax Sparse Attention (MSA), która rzadkuje uwagę softmax poprzez selekcję bloków, ale nie zawiera żadnych warstw uwagi liniowej. To pokazuje, że choć wielu gigantów AI zmierza w podobnym kierunku, branża nie osiągnęła jeszcze pełnej zgody co do optymalnej architektury, a debata na temat najlepszych metod przetwarzania długich kontekstów i zachowania zdolności rozumowania pozostaje otwarta.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

AQuA: Nowatorski system AI do autonomicznego odkrywania czynników i rozwoju modeli w finansach ilościowych
Naukowcy z Princeton, Ant Group i Stanforda przedstawili AQuA – dwuczęściowy system oparty na modelach językowych, który autonomicznie ulepsza procesy badawcze w finansach ilościowych, minimalizując ryzyko błędów.
Redakcja Aigestwczoraj

Anthropic prezentuje samodoskonalącą się sztuczną inteligencję
Badacz z Anthropic ujawnił wgląd w system AI zdolny do samodzielnego ulepszania swojego działania, co może zwiastować nową erę w rozwoju sztucznej inteligencji.
Redakcja Aigest5 dni temu

Thomson Reuters inwestuje 40 milionów dolarów w rozwój własnego modelu AI „Thomson”
Thomson Reuters wprowadza na rynek swój pierwszy wewnętrzny model językowy, „Thomson”, oparty na technologii Alibaba Qwen. Firma zainwestowała 40 milionów dolarów, stawiając na własność intelektualną zamiast polegać na z
Redakcja Aigest24 sie 2026

CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
Max Spero, CEO firmy Pangram, ostrzega przed rosnącym problemem zaufania w internecie, wynikającym z powszechnego użycia treści generowanych przez sztuczną inteligencję. Jego firma oferuje narzędzia do wykrywania AI, aby
Redakcja Aigest9 godz. temu

BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Artykuł analizuje skuteczność tradycyjnych benchmarków w ocenie dużych modeli językowych (LLM), wprowadzając koncepcję BenchMIRT, która ma lepiej oddawać ich rzeczywiste możliwości.
Redakcja Aigestwczoraj
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
OpenAI zapowiada model Astra, który jako pierwszy LLM osiągnął „krytyczny próg cyberbezpieczeństwa”, potrafiąc samodzielnie znajdować i wykorzystywać luki w systemach komputerowych. Firma planuje jego rychłe udostępnieni
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.