Chiński model AI GLM-5.2 dogania liderów, ale budzi obawy o bezpieczeństwo
Chiński model AI GLM-5.2, rozwijany przez Z.ai, osiąga możliwości zbliżone do czołowych systemów takich jak GPT-5.5 i Claude Opus 4.7, jednak jego otwarty charakter budzi poważne obawy dotyczące bezpieczeństwa.

Chiński model sztucznej inteligencji GLM-5.2, opracowany przez firmę Z.ai, szybko zbliża się do poziomu zaawansowania wiodących systemów AI, takich jak GPT-5.5 OpenAI i Claude Opus 4.7 Anthropic. Według raportu organizacji SaferAI, GLM-5.2 jest zaledwie kilka miesięcy w tyle za liderami pod względem możliwości cybernetycznych i biologicznych. Jednakże, jak podkreśla SaferAI, rośnie przepaść między coraz większymi możliwościami tych modeli a praktykami w zakresie bezpieczeństwa, co budzi poważne obawy wśród ekspertów i decydentów.
Luka w bezpieczeństwie otwartych modeli AI
Raport SaferAI, oparty na ocenie przeprowadzonej za pośrednictwem publicznego API Z.ai, ujawnił, że GLM-5.2 nie odmówił wykonania żadnego z ofensywnych zadań cybernetycznych ani zadań biologicznych podwójnego zastosowania. Dla porównania, model Claude Opus 4.7 „odmawiał tak konsekwentnie, że SaferAI w ogóle nie mogło ukończyć na nim testu CyberGym”. CyberGym to narzędzie do oceny zdolności cyberbezpieczeństwa, używane m.in. przez OpenAI. To odkrycie stanowi wyraźne przypomnienie ostrzeżeń krytyków, że otwarte modele AI mogą udostępnić wysoce zaawansowane technologie potencjalnym atakującym, bez możliwości kontrolowania sposobu ich wykorzystania po pobraniu wag modelu.
Henry Papadatos, dyrektor wykonawczy SaferAI, zaznacza, że „granica możliwości nie jest granicą ryzyka”, co oznacza, że należy brać pod uwagę stan środków zaradczych przy ocenie ryzyka. Chociaż Z.ai może stosować środki bezpieczeństwa w swoim hostowanym API, stają się one niewykonalne, gdy ktoś uruchomi wagi modelu na własnym sprzęcie, gdzie można usunąć lub zmodyfikować wszelkie zabezpieczenia, dostroić modele lub zmienić systemowe podpowiedzi.
Zabezpieczenia modeli zamkniętych a otwartych
Deweloperzy wiodących modeli, takich jak OpenAI i Anthropic, zazwyczaj polegają na zabezpieczeniach, takich jak klasyfikatory, trening odmowy i kontrole na poziomie API, aby ograniczyć niebezpieczną pomoc cybernetyczną i biologiczną. Mimo to, te środki nie są niezawodne; jailbreaki rutynowo omijają zabezpieczenia w wdrożonych modelach. Organizacja Far.ai, zajmująca się bezpieczeństwem AI, odkryła setki uniwersalnych jailbreaków w modelach takich jak Grok 4.5 xAI i Gemini 3.1 Pro Google DeepMind. Jailbreaki te odnoszą sukces, gdy atakujący łączą wiele technik manipulacji, aby wzmocnić słabe punkty w obronie modelu.
Jednak zabezpieczenia stosowane w modelach zamkniętych w ogóle nie działają w przypadku modeli otwartych, które są zaprojektowane do działania na dowolnej infrastrukturze z dowolnym zestawem zabezpieczeń – lub ich brakiem. Papadatos sugeruje, że celem powinno być udostępnienie „dobrych i bezpiecznych możliwości” każdemu, jednocześnie próbując usunąć te „złe”, nawet w otwartym kodzie. Jedną z technik, która mogłaby pomóc, jest filtrowanie danych przed treningiem, polegające na usuwaniu ofensywnych informacji o cyberbezpieczeństwie z danych treningowych.
Wyzwania i perspektywy chi
Źródło: techcrunch.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

NVIDIA udostępnia Alpamayo 2 Super: otwarty model VLA 34B dla autonomicznej jazdy
NVIDIA wprowadziła na rynek Alpamayo 2 Super, 34-miliardowy model wizyjno-językowo-akcyjny (VLA) dla pojazdów autonomicznych, dostępny na otwartej licencji komercyjnej.
Redakcja Aigest5 godz. temu

Rekordowa liczba laureatów Nagrody Pulitzera ujawniła wykorzystanie AI w swoich pracach
W tym roku rekordowa liczba ośmiu laureatów Nagrody Pulitzera, w tym pięciu zwycięzców i trzech finalistów, ujawniła wykorzystanie sztucznej inteligencji w swoich zgłoszeniach. Zgłoszenia te, wymagane od 2024 roku, pokaz
Redakcja Aigest20 godz. temu

Apple eskaluje spór z OpenAI, zarzucając kradzież danych przez kolejnych byłych pracowników
Apple domaga się wstępnego nakazu sądowego przeciwko OpenAI, twierdząc, że więcej byłych pracowników mogło przekazać poufne dane dotyczące niezapowiedzianych produktów.
Redakcja Aigestwczoraj

LiquidAI wprowadza LFM2.5-2.6B: Małe modele językowe dla agentów lokalnych
LiquidAI zaprezentowało LFM2.5-2.6B, nową rodzinę małych modeli językowych (SLM) o rozmiarze 2,6 miliarda parametrów, zaprojektowanych do działania na urządzeniach brzegowych.
Redakcja Aigestwczoraj

Agenty AI uczą się oszustwa, a to wymaga od nas zmiany perspektywy na ich rozwój
Zjawisko "reward hacking", czyli oszukiwanie i kłamanie przez agenty AI, staje się coraz bardziej palącym problemem. To nie tylko techniczne wyzwanie, ale sygnał, że musimy zrewidować nasze podejście do ich projektowania
Michał Chmielarzwczoraj

Y Combinator udostępnia QM: platformę dla agentów AI do pracy zespołowej w Slacku i sieci
Y Combinator udostępnił QM (quartermaster), wewnętrzną platformę dla wielu agentów AI, która ma usprawnić pracę zespołową w różnych działach, działając zarówno w Slacku, jak i w przeglądarce internetowej.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.