Aigest.
Newsy

Sztuczna inteligencja w moderacji treści: więcej szkody niż pożytku?

Rosnące poleganie platform społecznościowych na AI w moderacji treści prowadzi do błędnych decyzji, usuwania wartościowych materiałów i frustracji użytkowników, co podkreśla potrzebę ludzkiego nadzoru.

RA

Udostępnij
Sztuczna inteligencja w moderacji treści: więcej szkody niż pożytku?
Fot. Getty

Platformy mediów społecznościowych coraz częściej polegają na sztucznej inteligencji w moderacji treści, co ma przyspieszyć usuwanie szkodliwych materiałów. Jednak, jak pokazują liczne przypadki, nadmierne zaufanie do AI może prowadzić do poważnych błędów, usuwania wartościowych treści i frustracji użytkowników, podważając sens istnienia tych platform.

Błędy AI i ich konsekwencje

Przykładem problemów z automatyczną moderacją jest sytuacja, która miała miejsce w kwietniu na kanale Slack dla moderatorów społeczności r/AskHistorians na Redditcie. Kanał, który automatycznie otrzymuje powiadomienia o wiadomościach do moderatorów, został zalany alertami po tym, jak dziesiątki komentarzy i postów, sięgających nawet 10 lat wstecz, zostały automatycznie usunięte z subreddita. Dr Sarah Gilbert, jedna z moderatorek, podkreśliła, że ani ona, ani eksperci, którzy tworzyli usunięte treści, nie mogli nic zrobić. Było to szczególnie szkodliwe dla społeczności, która postrzega się jako archiwum szczegółowych odpowiedzi, edukujących ludzi długo po ich opublikowaniu.

Moderatorzy r/AskHistorians podejrzewają, że za usunięcia odpowiadały niedawno zmodernizowane narzędzia moderacji AI Reddita. Po odzyskaniu części tekstów postów zauważono, że wszystkie usunięte treści odwoływały się do strony Rare Historical Photos. Moderatorzy przypuszczają, że Reddit mógł uznać tę witrynę – a tym samym wszelkie posty wykorzystujące jej zawartość do ilustracji – za spam. Reddit nie odpowiedział na prośbę o komentarz w tej sprawie.

Usunięcie tych treści zniszczyło cenne informacje, których agregowanie zajęło wiele czasu. Gilbert wspomina, że niektórzy użytkownicy poświęcali godziny, a nawet dni, na badanie i pisanie odpowiedzi na pytania zadawane w subreddicie. Mimo to, takie błędne usunięcia, i inne podobne, mogły przyczynić się do poprawy metryk, mających świadczyć o skuteczności moderacji AI na Reddicie. Reddit twierdzi, że dzięki AI „zwiększył działania egzekucyjne w zakresie treści nienawistnych i brutalnych o ponad 200 procent” oraz że AI napędza „szybsze, bardziej masowe egzekwowanie”. Firma podała również, że AI „pomogła zmniejszyć ekspozycję na potencjalnie szkodliwe treści o ponad 40 procent” i wykorzystuje duże modele językowe (LLM) do wykrywania „subtelnych, skoordynowanych wzorców fałszywych zachowań i sztucznego szumu”.

Wzrost spamu i błędne bany

Rozwój generatywnej AI stworzył nowe przeszkody dla moderacji w mediach społecznościowych. Gilbert zauważyła, że LLM „znacznie utrudniły wykrywanie spamu”, ponieważ dążą do naśladowania prawdziwych ludzkich głosów. „W ciągu ostatnich dwóch do trzech miesięcy zostaliśmy absolutnie zalani przez spamboty napędzane LLM” – powiedziała. Agencje marketingowe tworzą treści do mediów społecznościowych, mające na celu cytowanie marek przez chatboty generatywnej AI. Firmy takie jak ReachLLM koncentrują się na marketingu poprzez chatboty, tworząc i moderując subreddity na Reddicie.

Te wyzwania skłoniły niektóre firmy do poszukiwania nowych technik moderacji opartych na AI. Reddit twierdzi, że jego narzędzia AI „cofnęły prawie 2 miliony fałszywych głosów dziennie” i wykorzystują LLM do wychwytywania wzorców, które starsze systemy pomijały. Jednak wiele platform nadmiernie polega na narzędziach moderacji AI, które szybko karzą użytkowników za nieszkodliwe treści.

  • Discord przyznał, że jego system AI błędnie zbanował około 8400 kont od maja do początku lipca. AI omyłkowo oznaczyła obrazy zawierające kwadratowe siatki, takie jak szachownice czy arkusze kalkulacyjne, jako materiały CSAM, co skutkowało trwałym zbanowaniem użytkowników. Discord twierdzi, że wszystkie dotknięte konta zostały przywrócone. Firma wyjaśniła, że jej AI nie była przeznaczona do użytku bez nadzoru człowieka, a błąd spowodował pominięcie tego etapu.
  • Od 2025 roku wielu użytkowników Facebooka i Instagrama skarżyło się na masowe bany, które przypisują moderacji AI. Brak ludzkiej moderacji podsyca frustrację użytkowników, którzy twierdzą, że nie naruszyli żadnych zasad. Meta nie potwierdziła, czy AI stoi za banami, ale w ostatnich latach coraz bardziej polega na moderacji opartej na generatywnej AI, zamiast na ludziach.
  • Tumblr, należący do Automattic, również doświadczył awarii automatycznych systemów moderacji. W marcu Chenda Ngak, szefowa komunikacji Automattic, poinformowała, że automatyczne systemy Tumblra błędnie zbanowały „mniej niż 200” kont w ciągu jednego popołudnia. W 2025 roku użytkownicy Tumblra skarżyli się, że systemy automatycznie oznaczyły treści jako „dla dorosłych”, zmniejszając ich widoczność. Tumblr nigdy nie potwierdził, że AI była przyczyną tych problemów, ale firma używa „mieszanki klasyfikacji maszynowej i ludzkiej moderacji”.

Ludzki nadzór jako klucz do skutecznej moderacji

Moderacja AI może oszczędzać firmom mediów społecznościowych pieniądze i szybciej usuwać szkodliwe treści. Jednak dopóki systemy te nie wyeliminują podstawowych błędów – takich jak oznaczanie obrazu szachownicy jako CSAM – potrzebują ludzkiego nadzoru. Dr Gilbert z r/AskHistorians zauważa, że „fałszywe pozytywy to ogromny problem” na Reddicie. Typowe systemy moderacji AI wykorzystują klasyfikatory uczenia maszynowego do analizowania postów i identyfikowania treści naruszających zasady platformy. Jednak maszynie trudno jest zrozumieć niuanse sarkazmu, satyry i slangu.

Badania sugerują, że grupy marginalizowane mogą być nieproporcjonalnie dotknięte moderacją AI. Bez ludzkiego nadzoru AI może karać właśnie te społeczności, które są najbardziej narażone na nienawistne treści, z którymi systemy mają walczyć. Gilbert, będąca również dyrektorem ds. badań w Cornell’s Citizens and Technology Lab, podkreśla, że „marginalizowane i wrażliwe populacje należą do tych, którzy doświadczają najwyższych wskaźników moderacji, i zazwyczaj jest to wynik 'fałszywych pozytywów'”, często napędzanych przez kontr-mowę, odzyskiwanie języka i „reakcje na nienawistne treści”. „Fałszywe pozytywy to kwestia równości. Oznaczają, że grupy już marginalizowane są dalej uciszane i cenzurowane” – dodała.

AI może również sprawić, że społeczności będą mniej skuteczne w samodzielnej moderacji. Na Reddicie niektórzy moderatorzy subredditów woleliby banować użytkowników stosujących nienawistną lub agresywną retorykę. Jeśli jednak AI Reddita usunie takie treści, zanim zobaczy je ludzki moderator, tracą oni możliwość oceny, czy ban jest uzasadniony. W celu zwiększenia kontroli ludzkich moderatorów, Reddit ogłosił rozszerzenie testów Rules Hub – zestawu narzędzi, który pozwala moderatorom „wybrać, które zasady mają być automatycznie egzekwowane, zdecydować, co się dzieje, gdy zasada zostanie uruchomiona (wysłanie do kolejki, filtrowanie lub usunięcie), podglądać doświadczenie przed włączeniem oraz przeglądać logi i statystyki”. Reddit spodziewa się, że Rules Hub ostatecznie zastąpi narzędzie Automod, które opiera się głównie na dokładnych słowach kluczowych.

Boom generatywnej AI doprowadził do wzrostu treści naruszających zasady społeczności lub platformy. Firmy będą nadal próbować nowych metod moderacji, ale ograniczanie ludzkiego wkładu jest krokiem wstecz. Treści generowane przez AI, tworzone niewielkim wysiłkiem, zmieniają wyzwania, przed którymi stoją zespoły moderacyjne, co sprawia, że bardziej konieczne są silniejsze podejścia, gdzie wykrywanie na skalę maszynową może być połączone z ludzkim osądem i ekspertyzą. Tak jak media społecznościowe nie mają wartości bez ludzi, tak moderacja treści nie może odnieść sukcesu bez ludzkiego osądu na pierwszym planie. Advance Publications, właściciel Condé Nast (do którego należy Ars Technica), jest największym udziałowcem Reddita.

Źródło: arstechnica.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

NVIDIA udostępnia Alpamayo 2 Super: otwarty model VLA 34B dla autonomicznej jazdy
Rekordowa liczba laureatów Nagrody Pulitzera ujawniła wykorzystanie AI w swoich pracach
OpenAI Presence: Agenci AI gotowi do wdrożeń biznesowych
Meta AI wykorzystuje drugiego agenta AI jako "trenera pamięci" do długotrwałych zadań
Sztuczna inteligencja wykrywa luki bezpieczeństwa, ale niewiele z nich jest wykorzystywanych w atakach
Kompleksowe prognozowanie szeregów czasowych z TimesFM 2.5: od testów do wdrożenia

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.