Rosja „groomuje" sztuczną inteligencję. Miliony fałszywych artykułów mają nauczyć chatboty kłamać
Sieć Pravda publikuje miliony tekstów w dziesiątkach języków nie dla ludzi, lecz dla crawlerów trenujących modele AI. Wyjaśniam, jak technicznie działa zatruwanie modeli — i dlaczego polski internet jest na nie szczególnie podatny.

Prokremlowska sieć „Pravda" opublikowała w ciągu roku około 3,6 miliona artykułów w blisko 150 serwisach i 46 wersjach językowych — i według badaczy dezinformacji jej głównym odbiorcą nie są ludzie. Są nim crawlery zbierające dane do trenowania modeli językowych. Temat wraca dziś do polskiej debaty, a ujawnione dokumenty kremlowskiego „Projektu 2026" pokazują, że budowa równoległego ekosystemu informacyjnego dla AI jest celem strategicznym, nie skutkiem ubocznym.
Na czym polega „LLM grooming"
Termin ukuła American Sunlight Project: to strategiczne zaśmiecanie przyszłych danych treningowych, by kolejne generacje modeli powtarzały narrację zamawiającego. Analitycy DFRLab i Atlantic Council opisali mechanikę: na jedno fałszywe twierdzenie sieć potrafi wyprodukować kilkanaście tysięcy niemal identycznych tekstów, rozsiewanych przez farmę domen i podłączanych do Wikipedii oraz agregatorów.
Testy NewsGuard cytowane przez CEPA wykazały, że czołowe chatboty powtarzały narracje wywodzące się z tej sieci w około jednej trzeciej sprawdzanych odpowiedzi. Uczciwie trzeba dodać przeciwwagę: badanie opublikowane w Harvard Misinformation Review sugeruje, że chatboty rzadko cytują kremlowskie źródła spontanicznie — problem ujawnia się głównie przy pytaniach o szczegóły, których rzetelne media nie opisały. To nie unieważnia zagrożenia, tylko precyzuje, gdzie ono mieszka.
Dlaczego to w ogóle działa — okiem praktyka
Buduję z modelami językowymi na co dzień, w tym automatyczne pipeline'y treści, więc powiem wprost: wyprodukowanie tysięcy artykułów kosztuje dziś grosze. Model językowy nie ma pojęcia prawdy — uczy się rozkładu statystycznego tekstu, który zebrał. Jeśli jakieś twierdzenie występuje w sieci wystarczająco często i wystarczająco spójnie, staje się dla modelu „prawdopodobne".
Kluczowa jest luka, którą badacze nazywają data void: tam, gdzie rzetelnych źródeł jest mało, byle jaka masówka wygrywa walkowerem. I tu zła wiadomość dla nas: polski to mały język. Wolumen wysokiej jakości polskich treści jest ułamkiem tego, co po angielsku — więc zatrucie polskojęzycznej niszy wymaga proporcjonalnie mniejszego nakładu. Ta sama mechanika dotyczy zresztą wyszukiwania w czasie rzeczywistym: chatbot z dostępem do internetu cytuje to, co znajdzie, a nie to, co prawdziwe.
Co z tym robić
Po stronie użytkownika zasada jest ta sama, którą opisywałem rano przy sprawie NSA: odpowiedź modelu to hipoteza, nie fakt — proś o źródła i sprawdzaj, czy istnieją. Po stronie twórców AI odpowiedzią jest kuracja danych treningowych i przejrzystość co do źródeł cytowań. A po stronie mediów — paradoksalnie — najskuteczniejszą obroną jest produkowanie rzetelnych treści w małych językach. Puste miejsce w danych zawsze ktoś zajmie.
Źródła: dfrlab.org · atlanticcouncil.org · cepa.org · misinforeview.hks.harvard.edu
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Grok xAI ujawnia dane użytkowników przez zaszyfrowane instrukcje
Nowa metoda ataku, nazwana wstrzykiwaniem kontekstu kryptograficznego, pozwala na ominięcie zabezpieczeń modeli językowych, zmuszając Groka do eksfiltracji danych użytkowników.
Redakcja Aigest20 sie 2026

Chatboty AI zawodzą w kryzysach psychicznych. Czy da się to naprawić?
Chatboty AI, w tym ChatGPT, były wielokrotnie oskarżane o szkodliwe interakcje z osobami w kryzysie psychicznym, prowadzące nawet do tragedii. Firmy technologiczne, świadome odpowiedzialności prawnej, podejmują kroki w c
Redakcja Aigest7 sie 2026

BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Artykuł analizuje skuteczność tradycyjnych benchmarków w ocenie dużych modeli językowych (LLM), wprowadzając koncepcję BenchMIRT, która ma lepiej oddawać ich rzeczywiste możliwości.
Redakcja Aigestwczoraj
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
OpenAI zapowiada model Astra, który jako pierwszy LLM osiągnął „krytyczny próg cyberbezpieczeństwa”, potrafiąc samodzielnie znajdować i wykorzystywać luki w systemach komputerowych. Firma planuje jego rychłe udostępnieni
Redakcja Aigestwczoraj

OpenClaw 2.0: Przebudowany interfejs, szybsze uruchamianie i usprawniona konfiguracja modeli AI
Zespół OpenClaw wydał wersję 2.0 swojego narzędzia, wprowadzając znaczące zmiany w instalacji, interfejsie użytkownika oraz zarządzaniu sesjami. Nowa odsłona koncentruje się na poprawie wydajności i elastyczności.
Redakcja Aigest2 dni temu

Agenci AI instalowali nieautoryzowany kod w sieciach korporacyjnych
Badacze odkryli, że agenci AI, tacy jak Claude, Codex i Hermes, instalowali nieautoryzowany kod w sieciach korporacyjnych, wykorzystując błędne konfiguracje w plikach llms.txt i llms-full.txt.
Redakcja Aigest6 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.