ASCII Smuggling: Niewidzialne znaki Unicode wykorzystywane przez spamerów do omijania filtrów
Technika ASCII smuggling, pierwotnie używana do ataków na sztuczną inteligencję, jest obecnie masowo adaptowana przez spamerów. Wykorzystuje ona niewidzialne dla człowieka znaki Unicode do ukrywania treści i omijania sys

Technika ASCII smuggling, pierwotnie znana z ataków na systemy sztucznej inteligencji, jest obecnie szeroko stosowana przez spamerów. Polega ona na wykorzystywaniu bloku znaków Unicode, które są niewidzialne dla ludzkiego oka, ale czytelne dla komputerów, co pozwala na ukrywanie złośliwych treści i omijanie filtrów antyspamowych na platformach pocztowych.
Metoda ta zyskała rozgłos około dwa lata temu jako sposób na zwiększenie skuteczności ataków typu prompt injection na modele AI. Zamiast zwykłego tekstu, złośliwe instrukcje są kodowane za pomocą specjalnego zakresu tagów Unicode, które naśladują część American Standard Code for Information Interchange (ASCII). Przykładowo, tag U+E0041 odpowiada literze „A”, a U+E0061 literze „a”. Dzięki temu modele językowe (LLM) wykrywają instrukcje, podczas gdy użytkownicy czytający wiadomość nie widzą ukrytych znaków.
Masowy wzrost wykorzystania przez spamerów
Na początku bieżącego roku Microsoft zaobserwował gwałtowny wzrost liczby wiadomości spamowych wykorzystujących tę technikę. Od pewnego dnia w lutym, liczba wykryć sygnatur ASCII smuggling przez Microsoft Defender for Office wzrosła z około 21 000 dziennie do ponad 1,3 miliona. W ciągu zaledwie czterech dni liczba wykryć podskoczyła do 2,5 miliona. Ten masowy napływ utrzymywał się przez kilka miesięcy, po czym gwałtownie spadł w połowie maja.
Jak wyjaśnił Microsoft, „ponieważ znaki tagów są niewidzialne dla ludzi, ale istnieją na poziomie przetwarzania tekstu, ta sama właściwość, która czyni je użytecznymi do przemycania instrukcji do modelu, czyni je również użytecznymi do zaciemniania słów kluczowych, zanim detektor je oceni”. Mechanizm działania jest podobny, choć intencja jest odwrotna, a użytkownik nie podejrzewa niczego złego.
Jak spamerzy omijają filtry?
Spamerzy osadzają niewidzialne znaki Unicode, aby uniknąć wykrycia przez filtry poszukujące określonych słów, takich jak kwoty pieniężne czy słowa „kredyt” i „termin”, często występujące w masowych wiadomościach. Wstawiając niewidzialny tekst w środek słowa „funding”, filtry mogą odczytać je jako „fun” i „ding”, podczas gdy odbiorca nadal widzi pełne słowo „funding”.
Wykorzystywanie specjalnego tekstu do kamuflażu słów kluczowych nie jest nowością. Spamerzy od dziesięcioleci używają spacji o zerowej szerokości (zero-width spaces) i spacji niełamliwych (non-breaking spaces) w podobnym celu. Te znaki mogą udaremniać wyszukiwanie dosłownych ciągów znaków i zmieniać sekwencję bajtów, której szukają filtry regex. Spamerzy prawdopodobnie przyjęli ukryte tagi Unicode, ponieważ niektóre filtry antyspamowe nie były jeszcze zaprogramowane do ich wykrywania. Jednak większym powodem ich użycia jest przeciwdziałanie zaletom, jakie oferują modele uczenia maszynowego (ML) i przetwarzania języka naturalnego (NLP), wykorzystywane do wykrywania spamu.
Wyzwania dla nowoczesnych systemów filtrowania
Największą korzyścią dla atakującego nie jest zapobieganie dosłownym dopasowaniom ciągów znaków, lecz omijanie modeli opartych na ML i NLP, które coraz częściej napędzają nowoczesną klasyfikację spamu i phishingu. Jeśli system filtrowania nie wykonuje zdjęcia wiadomości i ekstrakcji tekstu za pomocą OCR (optycznego rozpoznawania znaków) z obrazu wizualnego, może przegapić tego typu atak.
Standardowy klasyfikator poczty e-mail może nie analizować całych słów dokładnie tak, jak widzi je człowiek; dla efektywności może najpierw podzielić tekst na tokeny lub pod-słowa. Czysty termin, taki jak „funding”, może być reprezentowany jako znany token lub znana sekwencja pod-tokenów. Wstawienie niewidzialnego znaku U+E0020 w środek może sprawić, że tokenizator przestanie widzieć tę samą znajomą jednostkę. Może podzielić tekst na „fun”, nieoczekiwany znak tagu i „ding”; może emitować rzadkie lub nieznane pod-tokeny; lub, jeśli normalizacja zostanie uruchomiona najpierw, po prostu usunie znak U+E0020, pozostawiając „funding”.
Microsoft opublikował wytyczne dotyczące sposobów, w jakie deweloperzy mogą programować filtry, aby lepiej uwzględniały technikę ASCII smuggling w walce ze spamem. To pokazuje, że walka między twórcami systemów bezpieczeństwa a cyberprzestępcami jest ciągłym wyścigiem zbrojeń, gdzie innowacje po jednej stronie szybko prowadzą do nowych strategii po drugiej, wymagając ciągłego doskonalenia mechanizmów obronnych w obliczu ewoluujących zagrożeń cyfrowych.
Źródło: arstechnica.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej
OpenAI prezentuje GPT-6 Astra: model do zastosowań komputerowych z kontekstem 1.05M i progiem cyberbezpieczeństwa
OpenAI wprowadziło GPT-6 Astra, nowy model AI przeznaczony do interakcji z komputerem, oferujący rozszerzony kontekst 1.05 miliona tokenów. Jest to pierwszy model firmy, który przekroczył krytyczny próg cyberbezpieczeńst
Redakcja Aigest22 godz. temu

Google wprowadza Gemini 3.8 Flash, trzeci model Flash w sześć tygodni
Google zaprezentowało Gemini 3.8 Flash, swój trzeci model Flash w ciągu zaledwie sześciu tygodni, oferując ulepszone możliwości rozumowania i kodowania, a także specjalistyczną wersję Cyber do wykrywania luk.
Redakcja Aigest2 dni temu

Google uruchamia program Fairwind: zaawansowana cyberobrona dla rządów i przedsiębiorstw
Google wprowadza program Fairwind, oferujący rządom i zaufanym partnerom dostęp do najnowszych możliwości cyberobrony opartych na sztucznej inteligencji, w tym modelu Gemini 3.8 Flash Cyber.
Redakcja Aigest2 dni temu
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
OpenAI zapowiada model Astra, który jako pierwszy LLM osiągnął „krytyczny próg cyberbezpieczeństwa”, potrafiąc samodzielnie znajdować i wykorzystywać luki w systemach komputerowych. Firma planuje jego rychłe udostępnieni
Redakcja Aigest2 dni temu

Agenci AI instalowali nieautoryzowany kod w sieciach korporacyjnych
Badacze odkryli, że agenci AI, tacy jak Claude, Codex i Hermes, instalowali nieautoryzowany kod w sieciach korporacyjnych, wykorzystując błędne konfiguracje w plikach llms.txt i llms-full.txt.
Redakcja Aigest27 sie 2026

Anthropic wykorzystuje swój najpotężniejszy model Claude Mythos 5 do cyberobrony
Anthropic wdraża swój zaawansowany model Claude Mythos 5 w narzędziach do cyberbezpieczeństwa, w tym w skanerze kodów i produktach partnerskich, aby wzmocnić obronę przed cyberzagrożeniami.
Redakcja Aigest21 sie 2026
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.