Z.ai prezentuje GLM-5.3: skok w kodowaniu i cyberbezpieczeństwie bez ponownego trenowania modelu bazowego
Firma Z.ai wprowadziła na rynek GLM-5.3, nową wersję swojego modelu językowego, która znacząco poprawia możliwości w zakresie kodowania i cyberbezpieczeństwa, bazując na tym samym modelu podstawowym co poprzednik.

Firma Z.ai ogłosiła premierę GLM-5.3, nowej iteracji swojego modelu językowego, która wyróżnia się znaczącymi usprawnieniami w obszarach kodowania i cyberbezpieczeństwa. Co istotne, wszystkie odnotowane zyski wydajnościowe zostały osiągnięte dzięki skalowanemu post-treningowi, obejmującemu więcej środowisk zadań, różnorodne typy środowisk oraz dłuższy czas treningu, bez konieczności ponownego trenowania bazowego modelu 743B, na którym opiera się również GLM-5.2.
Znaczące postępy w kodowaniu
Model GLM-5.3 wykazuje największe skoki wydajności w benchmarkach dotyczących kodowania, szczególnie tych o najdłuższym horyzoncie zadań. Na przykład, w teście Terminal-Bench 3.0 wynik poprawił się z 4.6 do 28.3 w porównaniu do GLM-5.2. Inne znaczące usprawnienia obejmują:
- DeepSWE v1.1: wzrost z 46.2 do 66.9.
- Agents’ Last Exam (CLI): wzrost z 23.8 do 28.5.
- GDPval-AA v2 (obejmujący 44 zawody): GLM-5.3 osiągnął wynik 1769.
Na wewnętrznym benchmarku Z.ai Code Bench, firma odnotowała 50% poprawę w stosunku do GLM-5.2, osiągając 31.4% przy około 50 000 tokenów wyjściowych na zadanie. Dla porównania, Claude Opus 4.8 uzyskał 29.5% przy 120 000 tokenów, a Claude Fable 5 nadal prowadzi z wynikiem 39.5% przy maksymalnym wysiłku. Z.ai podkreśla, że użycie prywatnego benchmarku minimalizuje ryzyko kontaminacji danych.
Należy jednak zauważyć, że w publicznych zestawach testowych GLM-5.3 ustępuje modelom takim jak GPT-5.6 Sol i Fable 5 w kilku trudniejszych ewaluacjach kodowania. Wszystkie podane liczby są raportowane przez dostawców, a szczegóły dotyczące uprzęży testowych, długości kontekstu i ustawień próbkowania są udokumentowane w ogłoszeniu.
Niespodziewane wzmocnienie cyberbezpieczeństwa
Z.ai przyznaje, że znaczące postępy w cyberbezpieczeństwie były nieplanowane. Firma dodała dane dotyczące wykrywania luk w zabezpieczeniach, oczekując lepszej zdolności do rozumowania pojedynczych błędów. Zamiast tego, możliwości modelu rosły w miarę skalowania treningu, co doprowadziło do tego, że model zaczął tworzyć spójne plany w ramach kompletnych łańcuchów eksploatacji.
W teście CyberGym, który sprawdza wykrywanie i walidację z kodu źródłowego typu white-box, wynik poprawił się z 77.2% do 84.5%. To plasuje GLM-5.3 nieco powyżej Mythos 5 (83.8%) i GPT-5.6 Sol (83.6%). W ExploitBench, wymagającym rozumowania przyczyn źródłowych i stworzenia działającego exploita, wynik wzrósł z 24.4% do 54.4%, choć Mythos 5 nadal prowadzi z 78.0%.
Na platformie ExploitGym, GLM-5.3 ukończył 105 zadań w dwie godziny i 130 w sześć godzin, podczas gdy GLM-5.2 ukończył odpowiednio 29 i 39 zadań. Mythos 5 osiągnął 181 i 247 zadań. Obserwowany jest spójny wzorzec: im głębiej w łańcuch eksploatacji znajduje się benchmark, tym większy jest zysk GLM-5.3 w stosunku do GLM-5.2. Jednocześnie powiększa się luka w stosunku do zamkniętych modeli granicznych.
Dostępność i przyszłe plany
Częściowo, GLM-5.3 jest już dostępny poprzez API Z.ai, plan kodowania GLM oraz ZCode. Wagi modelu nie zostały jeszcze upublicznione, ale Z.ai planuje je opublikować około dwa tygodnie po premierze, po zakończeniu oceny bezpieczeństwa i utwardzania. Ten model pokazuje, jak intensywny post-trening może znacząco zwiększyć możliwości istniejących modeli bazowych, otwierając nowe perspektywy dla zastosowań AI w złożonych domenach, takich jak tworzenie oprogramowania i cyberbezpieczeństwo, bez konieczności kosztownego i czasochłonnego ponownego trenowania od podstaw.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej
Twitch i Anthropic pokazują, że etyka AI przegrywa z modelem biznesowym
Domyślne wykorzystywanie danych użytkowników do trenowania AI oraz niewidzialne znaki wodne w generowanych treściach to przykłady, jak firmy AI balansują na granicy etyki w pogoni za zyskiem.
Michał Chmielarz8 godz. temu


Hugging Face, Strands i LeRobot łączą siły dla usprawnienia rozwoju agentów AI
Hugging Face ogłosiło współpracę ze Strands i LeRobot, aby stworzyć zintegrowane środowisko do nagrywania, trenowania i wdrażania agentów AI. Inicjatywa ma na celu uproszczenie procesu rozwoju sztucznej inteligencji.
Redakcja Aigest23 godz. temu

Anthropic może osiągnąć wycenę 2 bilionów dolarów podczas debiutu giełdowego
Inwestorzy Anthropic, twórcy modelu Claude, przewidują, że startup AI może osiągnąć wycenę 2 bilionów dolarów lub więcej podczas planowanego debiutu giełdowego jesienią, co uczyniłoby go największą ofertą publiczną w his
Redakcja Aigestwczoraj

Młodzi o sztucznej inteligencji: od obojętności po obawy o kreatywność i środowisko
Badanie MIT Technology Review ujawnia zniuansowane podejście dzieci i młodzieży w wieku 10-18 lat do sztucznej inteligencji, od praktycznego wykorzystania po głębokie obawy o jej wpływ na społeczeństwo i środowisko.
Redakcja Aigestwczoraj

Agenci AI stają się kluczowym kierunkiem rozwoju i wyceny w branży
Wycena Cognition na 40 miliardów dolarów oraz nowe narzędzia od NVIDII i SpaceXAI pokazują, że agenci AI to nie tylko technologiczna nowinka, ale realny motor wzrostu i innowacji.
Michał Chmielarzwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.