Sztuczna inteligencja w moderacji treści: więcej szkody niż pożytku?
Rosnące poleganie platform społecznościowych na AI w moderacji treści prowadzi do błędnych decyzji, usuwania wartościowych materiałów i frustracji użytkowników, co podkreśla potrzebę ludzkiego nadzoru.

Platformy mediów społecznościowych coraz częściej polegają na sztucznej inteligencji w moderacji treści, co ma przyspieszyć usuwanie szkodliwych materiałów. Jednak, jak pokazują liczne przypadki, nadmierne zaufanie do AI może prowadzić do poważnych błędów, usuwania wartościowych treści i frustracji użytkowników, podważając sens istnienia tych platform.
Błędy AI i ich konsekwencje
Przykładem problemów z automatyczną moderacją jest sytuacja, która miała miejsce w kwietniu na kanale Slack dla moderatorów społeczności r/AskHistorians na Redditcie. Kanał, który automatycznie otrzymuje powiadomienia o wiadomościach do moderatorów, został zalany alertami po tym, jak dziesiątki komentarzy i postów, sięgających nawet 10 lat wstecz, zostały automatycznie usunięte z subreddita. Dr Sarah Gilbert, jedna z moderatorek, podkreśliła, że ani ona, ani eksperci, którzy tworzyli usunięte treści, nie mogli nic zrobić. Było to szczególnie szkodliwe dla społeczności, która postrzega się jako archiwum szczegółowych odpowiedzi, edukujących ludzi długo po ich opublikowaniu.
Moderatorzy r/AskHistorians podejrzewają, że za usunięcia odpowiadały niedawno zmodernizowane narzędzia moderacji AI Reddita. Po odzyskaniu części tekstów postów zauważono, że wszystkie usunięte treści odwoływały się do strony Rare Historical Photos. Moderatorzy przypuszczają, że Reddit mógł uznać tę witrynę – a tym samym wszelkie posty wykorzystujące jej zawartość do ilustracji – za spam. Reddit nie odpowiedział na prośbę o komentarz w tej sprawie.
Usunięcie tych treści zniszczyło cenne informacje, których agregowanie zajęło wiele czasu. Gilbert wspomina, że niektórzy użytkownicy poświęcali godziny, a nawet dni, na badanie i pisanie odpowiedzi na pytania zadawane w subreddicie. Mimo to, takie błędne usunięcia, i inne podobne, mogły przyczynić się do poprawy metryk, mających świadczyć o skuteczności moderacji AI na Reddicie. Reddit twierdzi, że dzięki AI „zwiększył działania egzekucyjne w zakresie treści nienawistnych i brutalnych o ponad 200 procent” oraz że AI napędza „szybsze, bardziej masowe egzekwowanie”. Firma podała również, że AI „pomogła zmniejszyć ekspozycję na potencjalnie szkodliwe treści o ponad 40 procent” i wykorzystuje duże modele językowe (LLM) do wykrywania „subtelnych, skoordynowanych wzorców fałszywych zachowań i sztucznego szumu”.
Wzrost spamu i błędne bany
Rozwój generatywnej AI stworzył nowe przeszkody dla moderacji w mediach społecznościowych. Gilbert zauważyła, że LLM „znacznie utrudniły wykrywanie spamu”, ponieważ dążą do naśladowania prawdziwych ludzkich głosów. „W ciągu ostatnich dwóch do trzech miesięcy zostaliśmy absolutnie zalani przez spamboty napędzane LLM” – powiedziała. Agencje marketingowe tworzą treści do mediów społecznościowych, mające na celu cytowanie marek przez chatboty generatywnej AI. Firmy takie jak ReachLLM koncentrują się na marketingu poprzez chatboty, tworząc i moderując subreddity na Reddicie.
Te wyzwania skłoniły niektóre firmy do poszukiwania nowych technik moderacji opartych na AI. Reddit twierdzi, że jego narzędzia AI „cofnęły prawie 2 miliony fałszywych głosów dziennie” i wykorzystują LLM do wychwytywania wzorców, które starsze systemy pomijały. Jednak wiele platform nadmiernie polega na narzędziach moderacji AI, które szybko karzą użytkowników za nieszkodliwe treści.
- Discord przyznał, że jego system AI błędnie zbanował około 8400 kont od maja do początku lipca. AI omyłkowo oznaczyła obrazy zawierające kwadratowe siatki, takie jak szachownice czy arkusze kalkulacyjne, jako materiały CSAM, co skutkowało trwałym zbanowaniem użytkowników. Discord twierdzi, że wszystkie dotknięte konta zostały przywrócone. Firma wyjaśniła, że jej AI nie była przeznaczona do użytku bez nadzoru człowieka, a błąd spowodował pominięcie tego etapu.
- Od 2025 roku wielu użytkowników Facebooka i Instagrama skarżyło się na masowe bany, które przypisują moderacji AI. Brak ludzkiej moderacji podsyca frustrację użytkowników, którzy twierdzą, że nie naruszyli żadnych zasad. Meta nie potwierdziła, czy AI stoi za banami, ale w ostatnich latach coraz bardziej polega na moderacji opartej na generatywnej AI, zamiast na ludziach.
- Tumblr, należący do Automattic, również doświadczył awarii automatycznych systemów moderacji. W marcu Chenda Ngak, szefowa komunikacji Automattic, poinformowała, że automatyczne systemy Tumblra błędnie zbanowały „mniej niż 200” kont w ciągu jednego popołudnia. W 2025 roku użytkownicy Tumblra skarżyli się, że systemy automatycznie oznaczyły treści jako „dla dorosłych”, zmniejszając ich widoczność. Tumblr nigdy nie potwierdził, że AI była przyczyną tych problemów, ale firma używa „mieszanki klasyfikacji maszynowej i ludzkiej moderacji”.
Ludzki nadzór jako klucz do skutecznej moderacji
Moderacja AI może oszczędzać firmom mediów społecznościowych pieniądze i szybciej usuwać szkodliwe treści. Jednak dopóki systemy te nie wyeliminują podstawowych błędów – takich jak oznaczanie obrazu szachownicy jako CSAM – potrzebują ludzkiego nadzoru. Dr Gilbert z r/AskHistorians zauważa, że „fałszywe pozytywy to ogromny problem” na Reddicie. Typowe systemy moderacji AI wykorzystują klasyfikatory uczenia maszynowego do analizowania postów i identyfikowania treści naruszających zasady platformy. Jednak maszynie trudno jest zrozumieć niuanse sarkazmu, satyry i slangu.
Badania sugerują, że grupy marginalizowane mogą być nieproporcjonalnie dotknięte moderacją AI. Bez ludzkiego nadzoru AI może karać właśnie te społeczności, które są najbardziej narażone na nienawistne treści, z którymi systemy mają walczyć. Gilbert, będąca również dyrektorem ds. badań w Cornell’s Citizens and Technology Lab, podkreśla, że „marginalizowane i wrażliwe populacje należą do tych, którzy doświadczają najwyższych wskaźników moderacji, i zazwyczaj jest to wynik 'fałszywych pozytywów'”, często napędzanych przez kontr-mowę, odzyskiwanie języka i „reakcje na nienawistne treści”. „Fałszywe pozytywy to kwestia równości. Oznaczają, że grupy już marginalizowane są dalej uciszane i cenzurowane” – dodała.
AI może również sprawić, że społeczności będą mniej skuteczne w samodzielnej moderacji. Na Reddicie niektórzy moderatorzy subredditów woleliby banować użytkowników stosujących nienawistną lub agresywną retorykę. Jeśli jednak AI Reddita usunie takie treści, zanim zobaczy je ludzki moderator, tracą oni możliwość oceny, czy ban jest uzasadniony. W celu zwiększenia kontroli ludzkich moderatorów, Reddit ogłosił rozszerzenie testów Rules Hub – zestawu narzędzi, który pozwala moderatorom „wybrać, które zasady mają być automatycznie egzekwowane, zdecydować, co się dzieje, gdy zasada zostanie uruchomiona (wysłanie do kolejki, filtrowanie lub usunięcie), podglądać doświadczenie przed włączeniem oraz przeglądać logi i statystyki”. Reddit spodziewa się, że Rules Hub ostatecznie zastąpi narzędzie Automod, które opiera się głównie na dokładnych słowach kluczowych.
Boom generatywnej AI doprowadził do wzrostu treści naruszających zasady społeczności lub platformy. Firmy będą nadal próbować nowych metod moderacji, ale ograniczanie ludzkiego wkładu jest krokiem wstecz. Treści generowane przez AI, tworzone niewielkim wysiłkiem, zmieniają wyzwania, przed którymi stoją zespoły moderacyjne, co sprawia, że bardziej konieczne są silniejsze podejścia, gdzie wykrywanie na skalę maszynową może być połączone z ludzkim osądem i ekspertyzą. Tak jak media społecznościowe nie mają wartości bez ludzi, tak moderacja treści nie może odnieść sukcesu bez ludzkiego osądu na pierwszym planie. Advance Publications, właściciel Condé Nast (do którego należy Ars Technica), jest największym udziałowcem Reddita.
Źródło: arstechnica.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

NVIDIA udostępnia Alpamayo 2 Super: otwarty model VLA 34B dla autonomicznej jazdy
NVIDIA wprowadziła na rynek Alpamayo 2 Super, 34-miliardowy model wizyjno-językowo-akcyjny (VLA) dla pojazdów autonomicznych, dostępny na otwartej licencji komercyjnej.
Redakcja Aigestwczoraj

Rekordowa liczba laureatów Nagrody Pulitzera ujawniła wykorzystanie AI w swoich pracach
W tym roku rekordowa liczba ośmiu laureatów Nagrody Pulitzera, w tym pięciu zwycięzców i trzech finalistów, ujawniła wykorzystanie sztucznej inteligencji w swoich zgłoszeniach. Zgłoszenia te, wymagane od 2024 roku, pokaz
Redakcja Aigestwczoraj

OpenAI Presence: Agenci AI gotowi do wdrożeń biznesowych
OpenAI wprowadza Presence, nową ofertę skierowaną do przedsiębiorstw, mającą na celu uczynienie agentów AI niezawodnymi w rzeczywistych zastosowaniach biznesowych. Rozwiązanie to ma usprawnić obsługę klienta i wewnętrzne
Redakcja Aigest4 dni temu

Meta AI wykorzystuje drugiego agenta AI jako "trenera pamięci" do długotrwałych zadań
Meta AI opracowała innowacyjny system, w którym drugi agent AI pełni funkcję "trenera pamięci", pomagając głównemu agentowi utrzymać spójność i unikać powtarzania błędów podczas złożonych zadań.
Redakcja Aigest4 dni temu

Sztuczna inteligencja wykrywa luki bezpieczeństwa, ale niewiele z nich jest wykorzystywanych w atakach
Analiza firmy VulnCheck wykazała, że choć AI pomaga odkrywać tysiące luk bezpieczeństwa, to tylko niewielki procent z nich jest faktycznie wykorzystywany w cyberatakach. Czas od ujawnienia luki do jej eksploitacji skraca
Redakcja Aigest4 dni temu

Kompleksowe prognozowanie szeregów czasowych z TimesFM 2.5: od testów do wdrożenia
Artykuł przedstawia zaawansowany, kompleksowy proces prognozowania szeregów czasowych z wykorzystaniem modelu TimesFM 2.5, obejmujący generowanie danych, testowanie i ocenę wydajności.
Redakcja Aigest4 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.