Aigest.
Newsy

ASCII Smuggling: Niewidzialne znaki Unicode wykorzystywane przez spamerów do omijania filtrów

Technika ASCII smuggling, pierwotnie używana do ataków na sztuczną inteligencję, jest obecnie masowo adaptowana przez spamerów. Wykorzystuje ona niewidzialne dla człowieka znaki Unicode do ukrywania treści i omijania sys

RA

Udostępnij
ASCII Smuggling: Niewidzialne znaki Unicode wykorzystywane przez spamerów do omijania filtrów
Fot. Daily hits on the ASCII smuggling signature, a week before and after onset. Credit: Microsoft

Technika ASCII smuggling, pierwotnie znana z ataków na systemy sztucznej inteligencji, jest obecnie szeroko stosowana przez spamerów. Polega ona na wykorzystywaniu bloku znaków Unicode, które są niewidzialne dla ludzkiego oka, ale czytelne dla komputerów, co pozwala na ukrywanie złośliwych treści i omijanie filtrów antyspamowych na platformach pocztowych.

Metoda ta zyskała rozgłos około dwa lata temu jako sposób na zwiększenie skuteczności ataków typu prompt injection na modele AI. Zamiast zwykłego tekstu, złośliwe instrukcje są kodowane za pomocą specjalnego zakresu tagów Unicode, które naśladują część American Standard Code for Information Interchange (ASCII). Przykładowo, tag U+E0041 odpowiada literze „A”, a U+E0061 literze „a”. Dzięki temu modele językowe (LLM) wykrywają instrukcje, podczas gdy użytkownicy czytający wiadomość nie widzą ukrytych znaków.

Masowy wzrost wykorzystania przez spamerów

Na początku bieżącego roku Microsoft zaobserwował gwałtowny wzrost liczby wiadomości spamowych wykorzystujących tę technikę. Od pewnego dnia w lutym, liczba wykryć sygnatur ASCII smuggling przez Microsoft Defender for Office wzrosła z około 21 000 dziennie do ponad 1,3 miliona. W ciągu zaledwie czterech dni liczba wykryć podskoczyła do 2,5 miliona. Ten masowy napływ utrzymywał się przez kilka miesięcy, po czym gwałtownie spadł w połowie maja.

Jak wyjaśnił Microsoft, „ponieważ znaki tagów są niewidzialne dla ludzi, ale istnieją na poziomie przetwarzania tekstu, ta sama właściwość, która czyni je użytecznymi do przemycania instrukcji do modelu, czyni je również użytecznymi do zaciemniania słów kluczowych, zanim detektor je oceni”. Mechanizm działania jest podobny, choć intencja jest odwrotna, a użytkownik nie podejrzewa niczego złego.

Jak spamerzy omijają filtry?

Spamerzy osadzają niewidzialne znaki Unicode, aby uniknąć wykrycia przez filtry poszukujące określonych słów, takich jak kwoty pieniężne czy słowa „kredyt” i „termin”, często występujące w masowych wiadomościach. Wstawiając niewidzialny tekst w środek słowa „funding”, filtry mogą odczytać je jako „fun” i „ding”, podczas gdy odbiorca nadal widzi pełne słowo „funding”.

Wykorzystywanie specjalnego tekstu do kamuflażu słów kluczowych nie jest nowością. Spamerzy od dziesięcioleci używają spacji o zerowej szerokości (zero-width spaces) i spacji niełamliwych (non-breaking spaces) w podobnym celu. Te znaki mogą udaremniać wyszukiwanie dosłownych ciągów znaków i zmieniać sekwencję bajtów, której szukają filtry regex. Spamerzy prawdopodobnie przyjęli ukryte tagi Unicode, ponieważ niektóre filtry antyspamowe nie były jeszcze zaprogramowane do ich wykrywania. Jednak większym powodem ich użycia jest przeciwdziałanie zaletom, jakie oferują modele uczenia maszynowego (ML) i przetwarzania języka naturalnego (NLP), wykorzystywane do wykrywania spamu.

Wyzwania dla nowoczesnych systemów filtrowania

Największą korzyścią dla atakującego nie jest zapobieganie dosłownym dopasowaniom ciągów znaków, lecz omijanie modeli opartych na ML i NLP, które coraz częściej napędzają nowoczesną klasyfikację spamu i phishingu. Jeśli system filtrowania nie wykonuje zdjęcia wiadomości i ekstrakcji tekstu za pomocą OCR (optycznego rozpoznawania znaków) z obrazu wizualnego, może przegapić tego typu atak.

Standardowy klasyfikator poczty e-mail może nie analizować całych słów dokładnie tak, jak widzi je człowiek; dla efektywności może najpierw podzielić tekst na tokeny lub pod-słowa. Czysty termin, taki jak „funding”, może być reprezentowany jako znany token lub znana sekwencja pod-tokenów. Wstawienie niewidzialnego znaku U+E0020 w środek może sprawić, że tokenizator przestanie widzieć tę samą znajomą jednostkę. Może podzielić tekst na „fun”, nieoczekiwany znak tagu i „ding”; może emitować rzadkie lub nieznane pod-tokeny; lub, jeśli normalizacja zostanie uruchomiona najpierw, po prostu usunie znak U+E0020, pozostawiając „funding”.

Microsoft opublikował wytyczne dotyczące sposobów, w jakie deweloperzy mogą programować filtry, aby lepiej uwzględniały technikę ASCII smuggling w walce ze spamem. To pokazuje, że walka między twórcami systemów bezpieczeństwa a cyberprzestępcami jest ciągłym wyścigiem zbrojeń, gdzie innowacje po jednej stronie szybko prowadzą do nowych strategii po drugiej, wymagając ciągłego doskonalenia mechanizmów obronnych w obliczu ewoluujących zagrożeń cyfrowych.

Źródło: arstechnica.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

OpenAI prezentuje GPT-6 Astra: model do zastosowań komputerowych z kontekstem 1.05M i progiem cyberbezpieczeństwa
Google wprowadza Gemini 3.8 Flash, trzeci model Flash w sześć tygodni
Google uruchamia program Fairwind: zaawansowana cyberobrona dla rządów i przedsiębiorstw
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
Agenci AI instalowali nieautoryzowany kod w sieciach korporacyjnych
Anthropic wykorzystuje swój najpotężniejszy model Claude Mythos 5 do cyberobrony

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.