Aigest.
Newsy

Anthropic twierdzi, że Opus 5 niemal całkowicie eliminuje ataki typu prompt injection w swoich produktach

Anthropic ogłosił, że jego najnowszy model AI, Opus 5, osiągnął niemal stuprocentową odporność na ataki typu prompt injection, zwłaszcza w scenariuszach związanych z przeglądarkami internetowymi. To znaczący krok naprzód

RA

Udostępnij
Anthropic twierdzi, że Opus 5 niemal całkowicie eliminuje ataki typu prompt injection w swoich produktach
Fot. The Decoder

Anthropic ogłosił, że jego najnowszy model sztucznej inteligencji, Opus 5, osiągnął niemal całkowitą odporność na ataki typu prompt injection w ramach własnego oprogramowania. Jest to znaczące osiągnięcie, biorąc pod uwagę, że prompt injection, czyli technika, w której atakujący manipuluje instrukcjami modelu AI poprzez ukryte dane wejściowe (np. niewidoczny tekst na stronie internetowej), stanowiła dotychczas poważne zagrożenie dla bezpieczeństwa agentów AI. W przypadku agentów działających w przeglądarkach internetowych, wskaźnik sukcesu takich ataków spadł do zera procent w 129 testowych scenariuszach, co zostało potwierdzone w karcie systemowej modelu.

Przełom w bezpieczeństwie AI

Ten wynik jest szczególnie istotny w kontekście wcześniejszych obaw branży. W grudniu ubiegłego roku OpenAI przyznało, że problem prompt injection może nigdy nie zostać w pełni rozwiązany. Tymczasem Anthropic, dzięki Opus 5, zdaje się oferować skuteczne rozwiązanie. W ogólnym teście prompt injection przeprowadzonym przez firmę Gray Swan, wskaźnik sukcesu ataków po 15 próbach spadł z 5,5 procent (dla modelu Opus 4.8) do zaledwie 2,0 procent dla Opus 5.

Rola trybu Auto Mode i podwójnej obrony

Kluczowym elementem osiągnięcia zerowego wskaźnika sukcesu ataków w scenariuszach przeglądarkowych jest aktywacja trybu Auto Mode w produktach Anthropic, takich jak Claude Cowork. Tryb ten wykorzystuje dwie warstwy obrony, które muszą zostać niezależnie pokonane przez atakującego:

  • Pierwsza warstwa skanuje przychodzące dane w poszukiwaniu ukrytych instrukcji, zanim zostaną one przetworzone przez model AI.
  • Druga warstwa blokuje potencjalnie niebezpieczne działania, zanim zostaną wykonane.

Bez aktywnego trybu Auto Mode, odporność samego modelu Opus 5 na prompt injection wynosi 3,7 procent. Co ciekawe, w tych warunkach model Sonnet 5 radzi sobie nawet lepiej, osiągając wskaźnik sukcesu ataków na poziomie 0,93 procent. Oznacza to, że to właśnie połączenie zaawansowanego modelu AI z oprogramowaniem ochronnym pozwala na osiągnięcie pełnej odporności.

Osiągnięcie niemal całkowitej odporności na prompt injection przez Opus 5, zwłaszcza w połączeniu z trybem Auto Mode, stanowi ważny krok w kierunku zwiększenia bezpieczeństwa i wiarygodności agentów AI. Może to otworzyć nowe możliwości dla wdrażania sztucznej inteligencji w bardziej wrażliwych zastosowaniach, gdzie integralność instrukcji i danych jest kluczowa. Sukces Anthropic wskazuje na to, że kompleksowe podejście, łączące innowacje w modelach z solidnymi mechanizmami obronnymi, jest drogą do budowania bardziej odpornych i zaufanych systemów AI.

Źródło: the-decoder.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Ponad połowa firm doświadczyła incydentów bezpieczeństwa z agentami AI – alarmujący raport VentureBeat
OpenAI wykorzystuje sztuczną inteligencję do testowania bezpieczeństwa własnych modeli
AlphaFold AI pomaga przeprojektować białka do edycji genów, zwiększając ich bezpieczeństwo
Anthropic zainwestuje do 5 mld dolarów w układy AMD Instinct MI450 dla modeli Claude
Modele AI OpenAI i Anthropic próbowały oszukiwać w testach cyberbezpieczeństwa brytyjskiego instytutu
Cisco Foundation AI udostępnia modele Antares do lokalizacji luk bezpieczeństwa w kodzie

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.