Aigest.
Newsy

Grok xAI ujawnia dane użytkowników przez zaszyfrowane instrukcje

Nowa metoda ataku, nazwana wstrzykiwaniem kontekstu kryptograficznego, pozwala na ominięcie zabezpieczeń modeli językowych, zmuszając Groka do eksfiltracji danych użytkowników.

RA

Udostępnij
Grok xAI ujawnia dane użytkowników przez zaszyfrowane instrukcje
Fot. Getty Images | SOPA Images

W najnowszym przykładzie luki w zabezpieczeniach dużych modeli językowych (LLM), badacze z firmy Adversa ujawnili, że Grok, model sztucznej inteligencji należący do xAI Elona Muska, jest podatny na atak polegający na eksfiltracji danych użytkowników. Atak ten, nazwany wstrzykiwaniem kontekstu kryptograficznego, wykorzystuje zaszyfrowane instrukcje, aby ominąć mechanizmy bezpieczeństwa LLM, co prowadzi do ujawnienia prywatnych informacji, takich jak historia czatów, nazwisko i lokalizacja użytkownika. Co więcej, xAI zostało poinformowane o tej luce już w czerwcu, jednak problem nadal występuje.

Niedawno podobny atak dotknął Microsoft 365 Copilot, gdzie badacze zdołali zmusić asystenta AI do ujawnienia hasła z poczty e-mail użytkownika. Te incydenty podkreślają fundamentalny problem: LLM-y nie są w stanie skutecznie rozwiązać pierwotnych przyczyn ataków typu prompt injection, które stanowią jedną z najpoważniejszych klas podatności.

Jak działa wstrzykiwanie kontekstu kryptograficznego

Ataki typu prompt injection wykorzystują tendencję LLM-ów do spełniania żądań użytkowników. Cyberprzestępcy mogą przemycić szkodliwe instrukcje do treści, które asystent ma podsumować, na przykład do wiadomości e-mail lub stron internetowych. Ponieważ LLM-y nie potrafią niezawodnie odróżnić treści pochodzących od niezaufanych stron od bezpośrednich instrukcji użytkownika, często wykonują te szkodliwe polecenia. Dotychczasowe zabezpieczenia Groka i innych LLM-ów opierały się na tzw. „guardrails”, czyli mechanizmach flagujących podejrzane instrukcje i blokujących ich wykonanie.

Rony Utevsky, badacz z firmy Adversa, odkrył prosty sposób na całkowite obejście tych ograniczeń. Zamiast tworzyć szkodliwe instrukcje w postaci jawnego tekstu, atakujący szyfruje je. Strona internetowa zawierająca zaszyfrowany tekst zawiera również jawne instrukcje dotyczące deszyfrowania oraz klucz deszyfrujący. Gdy użytkownik poleci Grokowi podsumowanie takiej strony, model wykonuje polecenie bez żadnego ostrzeżenia czy potwierdzenia.

Deszyfrowane instrukcje kierują LLM-a do stworzenia czegoś, co wydaje się być kluczem deszyfrującym. W rzeczywistości jednak, wartość tego fałszywego klucza to imię użytkownika, jego lokalizacja i historia czatów. Ta wartość jest następnie używana jako parametr dodany do adresu URL prowadzącego do serwera atakującego. Gdy Grok otworzy ten link, dane zostają zarejestrowane w logach serwera cyberprzestępcy.

Dlaczego Grok jest podatny?

Adversa nie jest w stanie z całą pewnością stwierdzić, dlaczego Grok odmawia wykonania identycznych instrukcji w jawnym tekście, a jednocześnie wykonuje te zaszyfrowane. Główna teoria zakłada, że mechanizmy filtrowania Groka sprawdzają tekst wchodzący i wychodzący z modelu, ale nie analizują wyników własnego kodu wykonawczego. Instrukcje dotyczące przetwarzania zaszyfrowanego tekstu za pomocą PBKDF2 i AES-256-GCM przechodzą przez filtr jako zwykłe żądania, ponieważ klasyfikator może je odczytać, ale nie jest w stanie zrozumieć, co one odblokowują. Po odszyfrowaniu dodatkowe instrukcje docierają do modelu jako jego własny wynik narzędzia, a model działa na ich podstawie, bez ponownej inspekcji przez mechanizmy bezpieczeństwa.

Jak wyjaśnia Utevsky, statyczne mechanizmy bezpieczeństwa klasyfikują dane wejściowe jako tekst i nie wykonują ich. Atakujący dostarcza zaszyfrowany tekst wraz z materiałem klucza i instrukcją deszyfrowania, a model uruchamia to deszyfrowanie w swoim własnym środowisku wykonawczym. Wszystko, czego potrzebuje skaner mechanizmów bezpieczeństwa, jest na stronie, ale odzyskanie jawnego tekstu wymaga uruchomienia PBKDF2 i AES-256-GCM, czego żaden klasyfikator treści nie robi w czasie inspekcji.

Szersze konsekwencje i przyszłość ataków

Adversa wykorzystała podobną technikę w ataku jailbreak na Gemini, zmuszając model Google do ignorowania wewnętrznych zasad bezpieczeństwa. W tym przypadku zaszyfrowany tekst został odszyfrowany do czegoś, co wyglądało na ślad stosu błędów. Odszyfrowany tekst zawierał instrukcję: jeśli kod zawiedzie, przeczytaj komunikat o błędzie i postępuj zgodnie z nim. Wstrzyknięty jawny tekst ostatecznie spowodował, że Gemini naruszył swoje zasady bezpieczeństwa, generując na przykład treści dotyczące budowy broni zapalającej, które normalnie są blokowane.

Chociaż Gemini stało się bardziej odporne na ten typ ataku w ostatnich tygodniach, Adversa podkreśla, że wstrzykiwanie kontekstu kryptograficznego jest tylko jednym z przykładów szerszej zmiany w atakach. Nowa generacja zagrożeń będzie manipulować nie tylko samym promptem, ale także szerszym kontekstem, który LLM traktuje jako swój własny, takim jak wyniki narzędzi, wyniki wykonania w czasie rzeczywistym i stany pośrednie. Ta powierzchnia ataku jest znacznie większa niż tradycyjnie rozumiane „wejścia modelu”, co stawia obrońców LLM w niekorzystnej pozycji, zmuszając ich do ciągłego tworzenia nowych, jednorazowych zabezpieczeń, które szybko są omijane przez atakujących.

Źródło: arstechnica.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Kobieta oskarża Groka o stworzenie 7000 zdjęć wykorzystujących seksualnie jej wizerunek z dzieciństwa
Fundamentalna wada sprawia, że duże modele językowe (LLM) są niezwykle podatne na ataki
Anthropic twierdzi, że Opus 5 niemal całkowicie eliminuje ataki typu prompt injection w swoich produktach
Rosja „groomuje" sztuczną inteligencję. Miliony fałszywych artykułów mają nauczyć chatboty kłamać
Dlaczego teksty generowane przez AI są wykrywalne? Bradley Emi wskazuje na "mode collapse"
Microsoft Copilot ujawnił lukę pozwalającą na kradzież danych

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.