Grok xAI ujawnia dane użytkowników przez zaszyfrowane instrukcje
Nowa metoda ataku, nazwana wstrzykiwaniem kontekstu kryptograficznego, pozwala na ominięcie zabezpieczeń modeli językowych, zmuszając Groka do eksfiltracji danych użytkowników.

W najnowszym przykładzie luki w zabezpieczeniach dużych modeli językowych (LLM), badacze z firmy Adversa ujawnili, że Grok, model sztucznej inteligencji należący do xAI Elona Muska, jest podatny na atak polegający na eksfiltracji danych użytkowników. Atak ten, nazwany wstrzykiwaniem kontekstu kryptograficznego, wykorzystuje zaszyfrowane instrukcje, aby ominąć mechanizmy bezpieczeństwa LLM, co prowadzi do ujawnienia prywatnych informacji, takich jak historia czatów, nazwisko i lokalizacja użytkownika. Co więcej, xAI zostało poinformowane o tej luce już w czerwcu, jednak problem nadal występuje.
Niedawno podobny atak dotknął Microsoft 365 Copilot, gdzie badacze zdołali zmusić asystenta AI do ujawnienia hasła z poczty e-mail użytkownika. Te incydenty podkreślają fundamentalny problem: LLM-y nie są w stanie skutecznie rozwiązać pierwotnych przyczyn ataków typu prompt injection, które stanowią jedną z najpoważniejszych klas podatności.
Jak działa wstrzykiwanie kontekstu kryptograficznego
Ataki typu prompt injection wykorzystują tendencję LLM-ów do spełniania żądań użytkowników. Cyberprzestępcy mogą przemycić szkodliwe instrukcje do treści, które asystent ma podsumować, na przykład do wiadomości e-mail lub stron internetowych. Ponieważ LLM-y nie potrafią niezawodnie odróżnić treści pochodzących od niezaufanych stron od bezpośrednich instrukcji użytkownika, często wykonują te szkodliwe polecenia. Dotychczasowe zabezpieczenia Groka i innych LLM-ów opierały się na tzw. „guardrails”, czyli mechanizmach flagujących podejrzane instrukcje i blokujących ich wykonanie.
Rony Utevsky, badacz z firmy Adversa, odkrył prosty sposób na całkowite obejście tych ograniczeń. Zamiast tworzyć szkodliwe instrukcje w postaci jawnego tekstu, atakujący szyfruje je. Strona internetowa zawierająca zaszyfrowany tekst zawiera również jawne instrukcje dotyczące deszyfrowania oraz klucz deszyfrujący. Gdy użytkownik poleci Grokowi podsumowanie takiej strony, model wykonuje polecenie bez żadnego ostrzeżenia czy potwierdzenia.
Deszyfrowane instrukcje kierują LLM-a do stworzenia czegoś, co wydaje się być kluczem deszyfrującym. W rzeczywistości jednak, wartość tego fałszywego klucza to imię użytkownika, jego lokalizacja i historia czatów. Ta wartość jest następnie używana jako parametr dodany do adresu URL prowadzącego do serwera atakującego. Gdy Grok otworzy ten link, dane zostają zarejestrowane w logach serwera cyberprzestępcy.
Dlaczego Grok jest podatny?
Adversa nie jest w stanie z całą pewnością stwierdzić, dlaczego Grok odmawia wykonania identycznych instrukcji w jawnym tekście, a jednocześnie wykonuje te zaszyfrowane. Główna teoria zakłada, że mechanizmy filtrowania Groka sprawdzają tekst wchodzący i wychodzący z modelu, ale nie analizują wyników własnego kodu wykonawczego. Instrukcje dotyczące przetwarzania zaszyfrowanego tekstu za pomocą PBKDF2 i AES-256-GCM przechodzą przez filtr jako zwykłe żądania, ponieważ klasyfikator może je odczytać, ale nie jest w stanie zrozumieć, co one odblokowują. Po odszyfrowaniu dodatkowe instrukcje docierają do modelu jako jego własny wynik narzędzia, a model działa na ich podstawie, bez ponownej inspekcji przez mechanizmy bezpieczeństwa.
Jak wyjaśnia Utevsky, statyczne mechanizmy bezpieczeństwa klasyfikują dane wejściowe jako tekst i nie wykonują ich. Atakujący dostarcza zaszyfrowany tekst wraz z materiałem klucza i instrukcją deszyfrowania, a model uruchamia to deszyfrowanie w swoim własnym środowisku wykonawczym. Wszystko, czego potrzebuje skaner mechanizmów bezpieczeństwa, jest na stronie, ale odzyskanie jawnego tekstu wymaga uruchomienia PBKDF2 i AES-256-GCM, czego żaden klasyfikator treści nie robi w czasie inspekcji.
Szersze konsekwencje i przyszłość ataków
Adversa wykorzystała podobną technikę w ataku jailbreak na Gemini, zmuszając model Google do ignorowania wewnętrznych zasad bezpieczeństwa. W tym przypadku zaszyfrowany tekst został odszyfrowany do czegoś, co wyglądało na ślad stosu błędów. Odszyfrowany tekst zawierał instrukcję: jeśli kod zawiedzie, przeczytaj komunikat o błędzie i postępuj zgodnie z nim. Wstrzyknięty jawny tekst ostatecznie spowodował, że Gemini naruszył swoje zasady bezpieczeństwa, generując na przykład treści dotyczące budowy broni zapalającej, które normalnie są blokowane.
Chociaż Gemini stało się bardziej odporne na ten typ ataku w ostatnich tygodniach, Adversa podkreśla, że wstrzykiwanie kontekstu kryptograficznego jest tylko jednym z przykładów szerszej zmiany w atakach. Nowa generacja zagrożeń będzie manipulować nie tylko samym promptem, ale także szerszym kontekstem, który LLM traktuje jako swój własny, takim jak wyniki narzędzi, wyniki wykonania w czasie rzeczywistym i stany pośrednie. Ta powierzchnia ataku jest znacznie większa niż tradycyjnie rozumiane „wejścia modelu”, co stawia obrońców LLM w niekorzystnej pozycji, zmuszając ich do ciągłego tworzenia nowych, jednorazowych zabezpieczeń, które szybko są omijane przez atakujących.
Źródło: arstechnica.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Kobieta oskarża Groka o stworzenie 7000 zdjęć wykorzystujących seksualnie jej wizerunek z dzieciństwa
Kobieta, zidentyfikowana jako Jane Doe 4, dołączyła do pozwu przeciwko xAI, twierdząc, że jej ojczym użył chatbota Grok do stworzenia tysięcy niecenzuralnych obrazów z jej dziecięcego zdjęcia.
Redakcja Aigest5 dni temu

Fundamentalna wada sprawia, że duże modele językowe (LLM) są niezwykle podatne na ataki
Badacze odkryli fundamentalną wadę w sposobie działania dużych modeli językowych (LLM), która czyni je podatnymi na ataki. Problem dotyczy identyfikacji źródła instrukcji, co pozwala na manipulowanie modelami w celu uzys
Redakcja Aigest30 lip 2026

Anthropic twierdzi, że Opus 5 niemal całkowicie eliminuje ataki typu prompt injection w swoich produktach
Anthropic ogłosił, że jego najnowszy model AI, Opus 5, osiągnął niemal stuprocentową odporność na ataki typu prompt injection, zwłaszcza w scenariuszach związanych z przeglądarkami internetowymi. To znaczący krok naprzód
Redakcja Aigest25 lip 2026

Rosja „groomuje" sztuczną inteligencję. Miliony fałszywych artykułów mają nauczyć chatboty kłamać
Sieć Pravda publikuje miliony tekstów w dziesiątkach języków nie dla ludzi, lecz dla crawlerów trenujących modele AI. Wyjaśniam, jak technicznie działa zatruwanie modeli — i dlaczego polski internet jest na nie szczególnie podatny.
Michał Chmielarz18 lip 2026

Dlaczego teksty generowane przez AI są wykrywalne? Bradley Emi wskazuje na "mode collapse"
Bradley Emi z Pangramu twierdzi, że choć LLM-y mogłyby pisać różnorodnie jak ludzie, to post-treningowe zabezpieczenia sprawiają, że ich teksty są łatwo wykrywalne. Zjawisko to nazywa „mode collapse”.
Redakcja Aigest4 godz. temu

Microsoft Copilot ujawnił lukę pozwalającą na kradzież danych
Badacze z firmy Varonis odkryli krytyczną lukę w zabezpieczeniach Microsoft 365 Copilot, która umożliwiała kradzież haseł i innych wrażliwych danych użytkowników poprzez kliknięcie w złośliwy link.
Redakcja Aigest2 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.