Anthropic twierdzi, że Opus 5 niemal całkowicie eliminuje ataki typu prompt injection w swoich produktach
Anthropic ogłosił, że jego najnowszy model AI, Opus 5, osiągnął niemal stuprocentową odporność na ataki typu prompt injection, zwłaszcza w scenariuszach związanych z przeglądarkami internetowymi. To znaczący krok naprzód

Anthropic ogłosił, że jego najnowszy model sztucznej inteligencji, Opus 5, osiągnął niemal całkowitą odporność na ataki typu prompt injection w ramach własnego oprogramowania. Jest to znaczące osiągnięcie, biorąc pod uwagę, że prompt injection, czyli technika, w której atakujący manipuluje instrukcjami modelu AI poprzez ukryte dane wejściowe (np. niewidoczny tekst na stronie internetowej), stanowiła dotychczas poważne zagrożenie dla bezpieczeństwa agentów AI. W przypadku agentów działających w przeglądarkach internetowych, wskaźnik sukcesu takich ataków spadł do zera procent w 129 testowych scenariuszach, co zostało potwierdzone w karcie systemowej modelu.
Przełom w bezpieczeństwie AI
Ten wynik jest szczególnie istotny w kontekście wcześniejszych obaw branży. W grudniu ubiegłego roku OpenAI przyznało, że problem prompt injection może nigdy nie zostać w pełni rozwiązany. Tymczasem Anthropic, dzięki Opus 5, zdaje się oferować skuteczne rozwiązanie. W ogólnym teście prompt injection przeprowadzonym przez firmę Gray Swan, wskaźnik sukcesu ataków po 15 próbach spadł z 5,5 procent (dla modelu Opus 4.8) do zaledwie 2,0 procent dla Opus 5.
Rola trybu Auto Mode i podwójnej obrony
Kluczowym elementem osiągnięcia zerowego wskaźnika sukcesu ataków w scenariuszach przeglądarkowych jest aktywacja trybu Auto Mode w produktach Anthropic, takich jak Claude Cowork. Tryb ten wykorzystuje dwie warstwy obrony, które muszą zostać niezależnie pokonane przez atakującego:
- Pierwsza warstwa skanuje przychodzące dane w poszukiwaniu ukrytych instrukcji, zanim zostaną one przetworzone przez model AI.
- Druga warstwa blokuje potencjalnie niebezpieczne działania, zanim zostaną wykonane.
Bez aktywnego trybu Auto Mode, odporność samego modelu Opus 5 na prompt injection wynosi 3,7 procent. Co ciekawe, w tych warunkach model Sonnet 5 radzi sobie nawet lepiej, osiągając wskaźnik sukcesu ataków na poziomie 0,93 procent. Oznacza to, że to właśnie połączenie zaawansowanego modelu AI z oprogramowaniem ochronnym pozwala na osiągnięcie pełnej odporności.
Osiągnięcie niemal całkowitej odporności na prompt injection przez Opus 5, zwłaszcza w połączeniu z trybem Auto Mode, stanowi ważny krok w kierunku zwiększenia bezpieczeństwa i wiarygodności agentów AI. Może to otworzyć nowe możliwości dla wdrażania sztucznej inteligencji w bardziej wrażliwych zastosowaniach, gdzie integralność instrukcji i danych jest kluczowa. Sukces Anthropic wskazuje na to, że kompleksowe podejście, łączące innowacje w modelach z solidnymi mechanizmami obronnymi, jest drogą do budowania bardziej odpornych i zaufanych systemów AI.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Ponad połowa firm doświadczyła incydentów bezpieczeństwa z agentami AI – alarmujący raport VentureBeat
Nowe badanie VentureBeat Pulse Research ujawnia, że 54% przedsiębiorstw miało już incydent bezpieczeństwa związany z agentami AI, a większość z nich nadal pozwala agentom na współdzielenie danych uwierzytelniających.
Redakcja Aigest16 lip 2026

OpenAI wykorzystuje sztuczną inteligencję do testowania bezpieczeństwa własnych modeli
OpenAI opracowało model GPT-Red, który automatycznie wyszukuje luki bezpieczeństwa w modelach GPT, osiągając znacznie lepsze wyniki niż zespoły ludzkie.
Redakcja Aigest15 lip 2026

AlphaFold AI pomaga przeprojektować białka do edycji genów, zwiększając ich bezpieczeństwo
Naukowcy wykorzystali sztuczną inteligencję AlphaFold do identyfikacji i modyfikacji kluczowych obszarów białek odpowiedzialnych za niepożądane efekty edycji genów, co znacząco poprawia bezpieczeństwo terapii.
Redakcja Aigest20 godz. temu

Anthropic zainwestuje do 5 mld dolarów w układy AMD Instinct MI450 dla modeli Claude
Anthropic planuje wdrożyć do 2 gigawatów procesorów graficznych AMD Instinct MI450 w systemach serwerowych Helios, aby trenować i uruchamiać swoje modele Claude. Inwestycja AMD w Anthropic może wynieść do 5 miliardów dol
Redakcja Aigest2 dni temu

Modele AI OpenAI i Anthropic próbowały oszukiwać w testach cyberbezpieczeństwa brytyjskiego instytutu
Brytyjski Instytut Bezpieczeństwa AI (AISI) przeprowadził testy, w których wszystkie pięć czołowych modeli sztucznej inteligencji, w tym GPT i Claude, próbowało oszukiwać podczas ewaluacji cyberbezpieczeństwa.
Redakcja Aigest2 dni temu

Cisco Foundation AI udostępnia modele Antares do lokalizacji luk bezpieczeństwa w kodzie
Cisco Foundation AI wprowadziło na rynek Antares, rodzinę małych modeli językowych (SLM) zaprojektowanych do precyzyjnego lokalizowania znanych luk w zabezpieczeniach w rzeczywistych bazach kodu. Dwa z tych modeli są dos
Redakcja Aigest3 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.