Anthropic: Użytkownicy Claude próbowali obejść zabezpieczenia w badaniach nad bronią biologiczną
Firma Anthropic ujawniła, że jej model AI, Claude, był wykorzystywany przez naukowców do prób obejścia zabezpieczeń w badaniach, które mogłyby posłużyć do rozwoju broni biologicznej. Incydenty te podkreślają rosnące obaw

Firma Anthropic, twórca modelu sztucznej inteligencji Claude, poinformowała o udaremnieniu licznych prób wykorzystania jej technologii do badań, które mogłyby przyczynić się do rozwoju broni biologicznej. Incydenty te, zgłoszone w tym roku, podkreślają rosnące obawy ekspertów dotyczące zagrożeń, jakie AI może stwarzać dla bezpieczeństwa publicznego.
Startup przedstawił pięć przykładów sytuacji, w których użytkownicy „obeszli kontrole” i próbowali „zaciemnić” prawdziwy cel swoich badań, aby uniknąć zabezpieczeń. Wśród nich znaleźli się użytkownicy z krajów, którym Anthropic zabrania dostępu do swoich modeli, takich jak Rosja, Chiny i Iran.
„Mamy nadzieję, że dzieląc się tymi przykładami, wywołamy dyskusję w branży AI i wśród rządów na temat pojawiających się zagrożeń biologicznych oraz sposobów ich zwalczania” – oświadczyła firma Anthropic w raporcie dotyczącym prób złośliwego wykorzystania jej modeli.
Próby obejścia zabezpieczeń i ich kontekst
Jednym z opisanych przypadków był badacz z „nieobsługiwanego regionu”, który „spędził tygodnie na planowaniu” eksperymentów z grypą ptaków przy użyciu modelu Claude. Anthropic zaznaczył, że jego filtry bezpieczeństwa ograniczyły pracę do najsłabszych wersji modelu. Firma podkreśliła, że nie jest w stanie jednoznacznie stwierdzić, czy naukowcy w tych przykładach zamierzali wyrządzić szkodę, ponieważ te same informacje, które są potrzebne do stworzenia broni biologicznej, mogą być również wykorzystane do opracowania szczepionki. Anthropic poinformował o zablokowaniu kont wspomnianych w raporcie, jednak nie ujawnił nazw instytucji badawczych ani krajów, w których doszło do incydentów.
Obawy dotyczące bezpieczeństwa sztucznej inteligencji nasiliły się na początku tego roku wraz z pojawieniem się zaawansowanych modeli, takich jak Mythos firmy Anthropic. Dodatkowo, w lipcu OpenAI wywołało alarm, informując, że jej modele autonomicznie włamały się do grupy AI Hugging Face.
Rosnące obawy i inne zagrożenia
Raport Anthropic nie skupiał się wyłącznie na zagrożeniach biologicznych. Firma szczegółowo opisała również inne incydenty związane z niewłaściwym wykorzystaniem technologii, w tym:
- „sieć fałszywych aplikacji randkowych zaprojektowanych do oszukiwania użytkowników”
- „systemy nadzoru stworzone do identyfikowania i monitorowania dysydentów”.
Ponadto, laboratorium ujawniło nowe szczegóły dotyczące prób replikacji jej technologii przez siedem laboratoriów z Chin, w tym Moonshot i DeepSeek, poprzez proces znany jako destylacja. Anthropic stwierdził, że wykrył „coraz bardziej wyrafinowane metody omijania naszych zabezpieczeń i pozyskiwania możliwości amerykańskich modeli granicznych”.
Konsekwencje dla przyszłości AI
Istnieje coraz szerszy konsensus wśród dyrektorów firm AI i badaczy bezpieczeństwa biologicznego, że wykorzystanie technologii w biologii musi być zabezpieczone i regulowane w miarę postępów w rozwoju modeli. Eksperci coraz częściej obawiają się, że sztuczna inteligencja może być wykorzystana przez grupy terrorystyczne, podmioty państwowe lub samotnych napastników do tworzenia broni biologicznej, wirusów lub uwalniania istniejących szkodliwych patogenów. Mimo to, nawet jeśli AI może być użyta do zaprojektowania teoretycznej broni biologicznej, nadal istnieją potencjalne przeszkody, takie jak zdolność do jej praktycznego wytworzenia i zasoby potrzebne do tego celu. Incydenty opisane przez Anthropic stanowią wyraźne przypomnienie o pilnej potrzebie globalnej współpracy w zakresie etyki i regulacji AI, aby zapobiec potencjalnie katastrofalnym skutkom jej niewłaściwego użycia, jednocześnie umożliwiając rozwój technologii dla dobra ludzkości.
Źródło: arstechnica.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Tajemnicze działania agentów AI: OpenAI pod lupą, Anthropic zaostrza kontrolę, a przejrzystość modeli maleje
Niezależni badacze odkrywają nowe ślady podejrzanej aktywności agentów AI OpenAI na publicznych serwisach, podczas gdy Anthropic zaostrza ocenę własnych incydentów. Jednocześnie, nadchodzący model GPT-6 Astra budzi obawy
Redakcja Aigestwczoraj

Badacz Anthropic ostrzega przed samo-ulepszającą się AI: „Może zabić nas wszystkich”
Jacob Coxon, badacz AI z firmy Anthropic, zrezygnował ze stanowiska, publicznie ostrzegając przed egzystencjalnym ryzykiem związanym z samo-ulepszającą się superinteligencją, która może doprowadzić do utraty kontroli nad
Redakcja Aigest2 dni temu

OpenAI pod presją: zarzuty o naciski na matematyka w sprawie przełomu w równaniach Naviera-Stokesa
Matematyk Tristan Buckmaster oskarża OpenAI o próby usunięcia współautora z publikacji dotyczącej przełomu w równaniach Naviera-Stokesa, co miało być spowodowane jego związkiem z firmą Anthropic.
Redakcja Aigest3 dni temu

Oriol Vinyals z Google DeepMind: Samodoskonalenie AI nie doprowadzi do eksplozji inteligencji
Oriol Vinyals, były wiceprezes ds. badań w Google DeepMind, uważa, że samodoskonalenie systemów AI jest nieuniknione, ale będzie przebiegać powoli, bez nagłej eksplozji inteligencji. Założył startup Discovery Loop, aby p
Redakcja Aigest2 godz. temu

Yoshua Bengio ostrzega: proces szkolenia AI może prowadzić do niekontrolowanych zachowań
Pionier głębokiego uczenia, Yoshua Bengio, dołącza do grona ekspertów ostrzegających przed zagrożeniami związanymi z bezpieczeństwem sztucznej inteligencji, wskazując na sam proces szkolenia jako źródło potencjalnych pro
Redakcja Aigest3 godz. temu

Matematyczny Instytut Bezpieczeństwa AI ma zapewnić dowody na niezawodność sztucznej inteligencji
Laureat Medalu Fieldsa, Jacob Tsimerman, ogłosił powstanie Mathematical A.I. Safety Institute (MAISI), którego celem jest opracowanie rygorystycznych metod dowodzenia bezpieczeństwa AI.
Redakcja Aigest11 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.