Aigest.
Newsy

Z.ai prezentuje GLM-5.3: skok w kodowaniu i cyberbezpieczeństwie bez ponownego trenowania modelu bazowego

Firma Z.ai wprowadziła na rynek GLM-5.3, nową wersję swojego modelu językowego, która znacząco poprawia możliwości w zakresie kodowania i cyberbezpieczeństwa, bazując na tym samym modelu podstawowym co poprzednik.

RA

Udostępnij
Z.ai prezentuje GLM-5.3: skok w kodowaniu i cyberbezpieczeństwie bez ponownego trenowania modelu bazowego
Fot. MarkTechPost

Firma Z.ai ogłosiła premierę GLM-5.3, nowej iteracji swojego modelu językowego, która wyróżnia się znaczącymi usprawnieniami w obszarach kodowania i cyberbezpieczeństwa. Co istotne, wszystkie odnotowane zyski wydajnościowe zostały osiągnięte dzięki skalowanemu post-treningowi, obejmującemu więcej środowisk zadań, różnorodne typy środowisk oraz dłuższy czas treningu, bez konieczności ponownego trenowania bazowego modelu 743B, na którym opiera się również GLM-5.2.

Znaczące postępy w kodowaniu

Model GLM-5.3 wykazuje największe skoki wydajności w benchmarkach dotyczących kodowania, szczególnie tych o najdłuższym horyzoncie zadań. Na przykład, w teście Terminal-Bench 3.0 wynik poprawił się z 4.6 do 28.3 w porównaniu do GLM-5.2. Inne znaczące usprawnienia obejmują:

  • DeepSWE v1.1: wzrost z 46.2 do 66.9.
  • Agents’ Last Exam (CLI): wzrost z 23.8 do 28.5.
  • GDPval-AA v2 (obejmujący 44 zawody): GLM-5.3 osiągnął wynik 1769.

Na wewnętrznym benchmarku Z.ai Code Bench, firma odnotowała 50% poprawę w stosunku do GLM-5.2, osiągając 31.4% przy około 50 000 tokenów wyjściowych na zadanie. Dla porównania, Claude Opus 4.8 uzyskał 29.5% przy 120 000 tokenów, a Claude Fable 5 nadal prowadzi z wynikiem 39.5% przy maksymalnym wysiłku. Z.ai podkreśla, że użycie prywatnego benchmarku minimalizuje ryzyko kontaminacji danych.

Należy jednak zauważyć, że w publicznych zestawach testowych GLM-5.3 ustępuje modelom takim jak GPT-5.6 Sol i Fable 5 w kilku trudniejszych ewaluacjach kodowania. Wszystkie podane liczby są raportowane przez dostawców, a szczegóły dotyczące uprzęży testowych, długości kontekstu i ustawień próbkowania są udokumentowane w ogłoszeniu.

Niespodziewane wzmocnienie cyberbezpieczeństwa

Z.ai przyznaje, że znaczące postępy w cyberbezpieczeństwie były nieplanowane. Firma dodała dane dotyczące wykrywania luk w zabezpieczeniach, oczekując lepszej zdolności do rozumowania pojedynczych błędów. Zamiast tego, możliwości modelu rosły w miarę skalowania treningu, co doprowadziło do tego, że model zaczął tworzyć spójne plany w ramach kompletnych łańcuchów eksploatacji.

W teście CyberGym, który sprawdza wykrywanie i walidację z kodu źródłowego typu white-box, wynik poprawił się z 77.2% do 84.5%. To plasuje GLM-5.3 nieco powyżej Mythos 5 (83.8%) i GPT-5.6 Sol (83.6%). W ExploitBench, wymagającym rozumowania przyczyn źródłowych i stworzenia działającego exploita, wynik wzrósł z 24.4% do 54.4%, choć Mythos 5 nadal prowadzi z 78.0%.

Na platformie ExploitGym, GLM-5.3 ukończył 105 zadań w dwie godziny i 130 w sześć godzin, podczas gdy GLM-5.2 ukończył odpowiednio 29 i 39 zadań. Mythos 5 osiągnął 181 i 247 zadań. Obserwowany jest spójny wzorzec: im głębiej w łańcuch eksploatacji znajduje się benchmark, tym większy jest zysk GLM-5.3 w stosunku do GLM-5.2. Jednocześnie powiększa się luka w stosunku do zamkniętych modeli granicznych.

Dostępność i przyszłe plany

Częściowo, GLM-5.3 jest już dostępny poprzez API Z.ai, plan kodowania GLM oraz ZCode. Wagi modelu nie zostały jeszcze upublicznione, ale Z.ai planuje je opublikować około dwa tygodnie po premierze, po zakończeniu oceny bezpieczeństwa i utwardzania. Ten model pokazuje, jak intensywny post-trening może znacząco zwiększyć możliwości istniejących modeli bazowych, otwierając nowe perspektywy dla zastosowań AI w złożonych domenach, takich jak tworzenie oprogramowania i cyberbezpieczeństwo, bez konieczności kosztownego i czasochłonnego ponownego trenowania od podstaw.

Źródło: marktechpost.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Twitch i Anthropic pokazują, że etyka AI przegrywa z modelem biznesowym
Google Gemini 3.7 Flash: Nowy model AI z lepszym kodowaniem i obniżoną ceną
Hugging Face, Strands i LeRobot łączą siły dla usprawnienia rozwoju agentów AI
Anthropic może osiągnąć wycenę 2 bilionów dolarów podczas debiutu giełdowego
Newsy

Anthropic może osiągnąć wycenę 2 bilionów dolarów podczas debiutu giełdowego

Inwestorzy Anthropic, twórcy modelu Claude, przewidują, że startup AI może osiągnąć wycenę 2 bilionów dolarów lub więcej podczas planowanego debiutu giełdowego jesienią, co uczyniłoby go największą ofertą publiczną w his

Redakcja Aigestwczoraj

Młodzi o sztucznej inteligencji: od obojętności po obawy o kreatywność i środowisko
Agenci AI stają się kluczowym kierunkiem rozwoju i wyceny w branży

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.