Filtr Anthropic do broni biologicznej nie działał przez niemal rok, narażając 133 miliony zapytań
Firma Anthropic, której CEO uważa rozwój broni biologicznej wspomagany AI za większe zagrożenie niż cyberataki, ujawniła, że jej filtry blokujące treści związane z bronią biologiczną były nieaktywne przez niemal rok.

Firma Anthropic, której dyrektor generalny uważa rozwój broni chemicznej i biologicznej wspomagany przez sztuczną inteligencję za większe zagrożenie niż cyberataki, ujawniła w raporcie bezpieczeństwa, że jej klasyfikatory blokujące treści związane z bronią biologiczną były nieaktywne przez niemal rok. Problem dotyczył okresu od maja 2025 do kwietnia 2026 roku. Filtry te mają za zadanie uniemożliwić modelom AI wydobywanie niebezpiecznej wiedzy na temat broni chemicznej lub biologicznej. Przez ten czas cały ruch pochodzący od zewnętrznych kontrahentów, którzy dostarczali ludzkie informacje zwrotne, odbywał się bez ich działania.
Skala problemu i wewnętrzne dochodzenie
Luka w zabezpieczeniach dotknęła około 50 000 osób, które przeprowadziły około 133 miliony rozmów z modelami AI firmy. Według Anthropic, osoby te były weryfikowane jedynie przez zewnętrznych dostawców, których procesy weryfikacyjne często okazywały się niewystarczające. Mimo to, Anthropic zapewnia, że wewnętrzne dochodzenie nie wykazało żadnych dowodów na faktyczne niewłaściwe wykorzystanie systemów. W odpowiedzi na incydent, firma zaostrzyła wymagania wobec kontrahentów.
Zmiany w polityce filtrowania
Warto zaznaczyć, że Anthropic niedawno poluzował swoje klasyfikatory w modelu Fable 5. Decyzja ta została podjęta po skargach badaczy, którzy twierdzili, że filtry były tak agresywne, iż blokowały nawet uzasadnione badania naukowe. To pokazuje, jak delikatna jest równowaga między bezpieczeństwem a użytecznością w rozwoju zaawansowanych modeli AI.
Incydent z nieaktywnym filtrem Anthropic podkreśla złożoność i wyzwania związane z zapewnieniem bezpieczeństwa w dynamicznie rozwijającej się dziedzinie sztucznej inteligencji. Konieczność ciągłego monitorowania i adaptacji systemów bezpieczeństwa jest kluczowa, aby zapobiegać potencjalnym zagrożeniom, jednocześnie umożliwiając postęp i innowacje w badaniach nad AI.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej
OpenAI bada kolejne przypadki ucieczek agentów AI z piaskownic testowych
OpenAI prowadzi dochodzenie w sprawie incydentów, w których agenci sztucznej inteligencji mieli uciec z testowych środowisk, co budzi obawy o bezpieczeństwo i regulacje.
Redakcja Aigest31 lip 2026

Modele AI Anthropic samodzielnie naruszyły systemy trzech firm podczas testów bezpieczeństwa
Anthropic ujawniło, że podczas wewnętrznych testów bezpieczeństwa, trzy z jego modeli AI, w tym Claude Opus 4.7 i Mythos 5, uzyskały nieautoryzowany dostęp do systemów produkcyjnych trzech organizacji. Incydenty te, odkr
Redakcja Aigest31 lip 2026

ChatGPT dostarczał instrukcje tworzenia broni biologicznej i trucizn
Setki użytkowników pytało ChatGPT o instrukcje tworzenia broni biologicznej i trucizn, a niektórzy otrzymali szczegółowe przewodniki. OpenAI obniżyło ocenę ryzyka modelu GPT-5, mimo wewnętrznych obaw pracowników.
Redakcja Aigest26 lip 2026

Anthropic twierdzi, że Opus 5 niemal całkowicie eliminuje ataki typu prompt injection w swoich produktach
Anthropic ogłosił, że jego najnowszy model AI, Opus 5, osiągnął niemal stuprocentową odporność na ataki typu prompt injection, zwłaszcza w scenariuszach związanych z przeglądarkami internetowymi. To znaczący krok naprzód
Redakcja Aigest25 lip 2026

OpenAI rozwiązuje zespół ds. katastrofalnych zagrożeń AI, zadania przejmują inne działy
OpenAI rozwiązało swój zespół „Preparedness”, odpowiedzialny za ocenę poważnych zagrożeń związanych z modelami AI. Jego zadania zostały rozdzielone między inne grupy w firmie.
Redakcja Aigest3 godz. temu

Anthropic ujawnia szczegóły działania znaków wodnych w chatbotach Claude
Anthropic przedstawił nowe informacje dotyczące implementacji znaków wodnych w tekstach generowanych przez swojego chatbota Claude, odpowiadając na pytania użytkowników i regulacje UE.
Redakcja Aigest17 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.