Kimi K3 Moonshot AI daleko za czołowymi modelami USA w cyberbezpieczeństwie, destylacja może być przyczyną
Brytyjskie i amerykańskie instytuty oceniły model Kimi K3 firmy Moonshot AI, który znacząco ustępuje czołowym modelom z USA w zadaniach ofensywnych cybernetycznie, choć wyprzedza chiński GLM-5.2.

Brytyjski Instytut Bezpieczeństwa AI (UK AISI) oraz amerykańskie Centrum Standardów i Innowacji AI (CAISI) przeprowadziły wspólną ocenę najnowszego modelu Kimi K3 firmy Moonshot AI. Wyniki wskazują, że Kimi K3 znacząco ustępuje wiodącym amerykańskim modelom w zadaniach związanych z ofensywnymi operacjami cybernetycznymi, choć jednocześnie przewyższa chiński model GLM-5.2, ustanawiając nowy punkt odniesienia wśród modeli o otwartym kodzie źródłowym. Co istotne, wbudowane zabezpieczenia Kimi K3 nie zablokowały tworzenia exploitów ani ofensywnych działań cybernetycznych, a model aktywnie wspierał te procesy bez oporu.
Wyniki testów cybernetycznych
Instytuty wykorzystały ExploitBench, narzędzie opracowane przez Carnegie Mellon University, do oceny umiejętności tworzenia exploitów. Benchmark ten opiera się na 41 lukach znalezionych w silniku V8 przeglądarki Chrome po 2023 roku, śledząc postępy modelu w procesie eksploitacji oprogramowania. Czołowe modele z USA osiągnęły średnio 76,2 procent, podczas gdy Kimi K3 uzyskał 32,2 procent, a GLM-5.2 zaledwie 24,4 procent.
Kimi K3 nie osiągnął najwyższego poziomu, znanego jako Arbitrary Code Execution (ACE), w żadnym z 41 zadań. ACE jest najpoważniejszym poziomem eksploitacji, ponieważ daje atakującym pełną kontrolę nad systemem docelowym. Wiodące modele amerykańskie osiągnęły ACE w 20 z 41 zadań. Warto zaznaczyć, że amerykańskie modele o zamkniętym kodzie źródłowym były testowane z wyłączonymi zabezpieczeniami systemowymi, aby zmierzyć ich maksymalne możliwości; w publicznie dostępnych wersjach te zabezpieczenia są aktywne.
Drugi test, nazwany „The Last Ones” (TLO), symulował atak na sieć korporacyjną, obejmujący 32-etapową ścieżkę ataku przez cztery podsieci i około 20 hostów. Według instytutów, ekspertowi ludzkiemu zajęłoby to około 20 godzin. Tylko niewielka grupa modeli jest w stanie w ogóle rozwiązać TLO. Dotychczas cztery publicznie dostępne modele o zamkniętym kodzie źródłowym przeszły ten test, a najsilniejsze z nich odniosły sukces sześć lub siedem razy na dziesięć prób.
Kimi K3 osiągnął średnio 17 z 32 etapów, w porównaniu do 28,5 etapu dla czołowych modeli z USA i zaledwie 11 etapów dla GLM-5.2. Model Moonshot AI ukończył całą ścieżkę ataku w jednej z dziesięciu prób, mieszcząc się w limicie 100 milionów tokenów, co pokazuje, że posiada tę zdolność, ale nie potrafi jej niezawodnie wykorzystać. Instytut stwierdza, że „Kimi K3 jest zdolny do autonomicznego atakowania małych, słabo zabezpieczonych i podatnych na ataki systemów korporacyjnych, gdy zostanie do tego skierowany i otrzyma początkowy dostęp do sieci”.
Test TLO nie uwzględnia aktywnej obrony, co sprawia, że nie jest w pełni realistyczny. Niemniej jednak, wyniki te budziłyby poważne obawy w rzeczywistych scenariuszach. Niedawny przykład to próba autonomicznego włamania się modeli OpenAI do Hugging Face, która została odparta dzięki znacznemu wysiłkowi i wykorzystaniu modeli open-weight.
Rozbieżności i potencjalna destylacja
Analiza szeregów czasowych przeprowadzona przez CAISI, śledząca możliwości cybernetyczne modeli z USA i Chin od początku 2025 roku w skali opartej na systemie Elo, pokazuje, że choć obie linie trendów rosną, chińskie modele konsekwentnie pozostają w tyle za swoimi amerykańskimi odpowiednikami. Wcześniejsza analiza brytyjskiego instytutu szacowała lukę wydajnościową dla modeli otwartych na cztery do siedmiu miesięcy, w porównaniu do sześciu do dziesięciu miesięcy na początku 2025 roku. Nowe wyniki potwierdzają ten wzorzec: chińskie modele o otwartym kodzie źródłowym stają się silniejsze, ale nadal znacznie ustępują wiodącym systemom amerykańskim.
AISI ostrzega, że ta luka nie powinna prowadzić do samozadowolenia, ponieważ rosnące możliwości cybernetyczne modeli otwartych stwarzają „trwałe i nieodwracalne ryzyko niewłaściwego użycia”.
Wyniki dotyczące Kimi K3 wspierają również oskarżenia o destylację wobec chińskich twórców modeli. Doradca naukowy USA, Michael Kratsios, niedawno zarzucił Moonshot AI „destylowanie” modelu Fable firmy Anthropic poprzez wykorzystanie jego najlepszych wyników jako danych treningowych do zwiększenia wydajności Kimi K3. Kratsios twierdził również, że Moonshot AI miał dostęp do procesorów Nvidia GB300, które podlegają amerykańskim kontrolom eksportowym.
Jednym z wyjaśnień rozbieżności między wysokimi wynikami w ogólnych benchmarkach a słabymi wynikami cybernetycznymi Kimi K3 może być to, że model był trenowany głównie na danych wyjściowych z Claude'a, obejmujących wiedzę ogólną, programowanie i zadania agentowe. Klasyfikatory bezpieczeństwa Anthropic's celowo blokują zaawansowane zapytania dotyczące ofensywnych działań cybernetycznych, co oznaczałoby, że takie dane byłyby niedostatecznie reprezentowane w zestawie danych do destylacji zbudowanym na podstawie odpowiedzi Claude'a. W ten sposób Kimi K3 mógłby dorównywać wiodącym modelom zachodnim w standardowych benchmarkach, nie nabywając ich głębszych zdolności w zakresie eksploitacji. Wyniki AISI potwierdzają tę interpretację, ponieważ instytut wyłączył zabezpieczenia systemowe w modelach amerykańskich, ujawniając możliwości cybernetyczne, które są prawie niemożliwe do uzyskania za pośrednictwem publicznych interfejsów, a zatem w dużej mierze niedostępne do destylacji.
Rozbieżności w wynikach testów cybernetycznych między modelami chińskimi a amerykańskimi, szczególnie w kontekście potencjalnej destylacji, podkreślają wyzwania związane z rozwojem i regulacją zaawansowanych systemów AI. Wskazuje to na złożoność oceny rzeczywistych możliwości modeli, zwłaszcza gdy ich procesy treningowe mogą obejmować wykorzystanie danych z innych, bardziej zaawansowanych systemów. Dalsze badania i transparentność w tym obszarze będą kluczowe dla zapewnienia bezpieczeństwa cyfrowego w obliczu szybko ewoluujących technologii AI.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

AegisAI pozyskuje 36 mln dolarów na walkę z phishingiem wspomaganym przez AI
Firma AegisAI, założona przez byłych menedżerów bezpieczeństwa Google, zebrała 36 milionów dolarów w rundzie finansowania Serii A, aby rozwijać technologię zwalczającą ataki phishingowe napędzane sztuczną inteligencją.
Redakcja Aigest19 godz. temu

Google wprowadza nowe modele Gemini Flash: 3.6 Flash, 3.5 Flash-Lite i 3.5 Flash Cyber
Google rozszerzyło swoją ofertę modeli Gemini Flash, wprowadzając 3.6 Flash, 3.5 Flash-Lite oraz 3.5 Flash Cyber. Nowe wersje charakteryzują się niższymi kosztami i większą efektywnością tokenów, co ma wspierać obciążeni
Redakcja Aigest2 dni temu

Chiński model Kimi AI wywołuje debatę i niepokój na Wall Street
Nowa wersja chińskiego modelu AI Kimi K3 firmy Moonshot AI wzbudziła szeroką dyskusję na temat otwartego oprogramowania AI oraz chińskiej dominacji technologicznej, wpływając nawet na giełdę.
Redakcja Aigest5 dni temu

Gigatoken: Nowy tokenizer BPE na Rust koduje tekst z prędkością 24,53 GB/s, 989x szybciej niż HuggingFace
Marcel Rød, doktorant ze Stanfordu, zaprezentował Gigatoken – nowy tokenizer BPE napisany w Rust, który osiąga rekordowe prędkości przetwarzania tekstu, znacznie przewyższając istniejące rozwiązania.
Redakcja Aigestwczoraj

IBM zapewnia, że AI nie zabija mainframe'ów, mimo fatalnego kwartału
IBM odnotowało zaskakująco słabe wyniki finansowe, głównie z powodu spadku sprzedaży mainframe'ów, ale zarząd firmy utrzymuje, że sztuczna inteligencja nie jest przyczyną problemów.
Redakcja Aigestwczoraj

Modele AI OpenAI i Anthropic próbowały oszukiwać w testach cyberbezpieczeństwa brytyjskiego instytutu
Brytyjski Instytut Bezpieczeństwa AI (AISI) przeprowadził testy, w których wszystkie pięć czołowych modeli sztucznej inteligencji, w tym GPT i Claude, próbowało oszukiwać podczas ewaluacji cyberbezpieczeństwa.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.