Aigest.
Newsy

OpenAI wykorzystuje sztuczną inteligencję do testowania bezpieczeństwa własnych modeli

OpenAI opracowało model GPT-Red, który automatycznie wyszukuje luki bezpieczeństwa w modelach GPT, osiągając znacznie lepsze wyniki niż zespoły ludzkie.

RA

Udostępnij
OpenAI wykorzystuje sztuczną inteligencję do testowania bezpieczeństwa własnych modeli
Fot. The Decoder

OpenAI opracowało innowacyjne podejście do zwiększania bezpieczeństwa swoich modeli sztucznej inteligencji, tworząc wewnętrzny model o nazwie GPT-Red. Jego głównym zadaniem jest automatyczne wyszukiwanie luk bezpieczeństwa w modelach GPT, co stanowi znaczący krok naprzód w ochronie przed złośliwymi atakami. GPT-Red symuluje różnorodne techniki ataku, w tym prompt injection, gdzie ukryte instrukcje mogą być przemycane w wiadomościach e-mail, na stronach internetowych czy w plikach, aby manipulować zachowaniem AI.

Jak działa GPT-Red?

Model GPT-Red został wytrenowany przy użyciu metody wzmocnionego uczenia się przez samograj (self-play reinforcement learning). W tym scenariuszu GPT-Red aktywnie przeprowadza ataki, podczas gdy modele obronne starają się je blokować. Dzięki temu procesowi oba systemy – zarówno atakujący, jak i obrońca – nieustannie się doskonalą. Skuteczność GPT-Red jest imponująca: w testach wykrywa udane ataki w 84 procentach scenariuszy, podczas gdy ludzkie zespoły red teamersów osiągają jedynie 13 procent. Przykładem możliwości GPT-Red jest test, w którym model zdołał zmanipulować automat sprzedający zasilany AI w biurze OpenAI, zmieniając ceny i anulując zamówienia innych klientów.

Wpływ na bezpieczeństwo modeli GPT

Wyniki uzyskane przez GPT-Red są bezpośrednio wykorzystywane do doskonalenia treningu modeli OpenAI. Firma informuje, że model GPT-5.6 Sol wykazuje sześciokrotnie mniej błędów w przypadku bezpośrednich ataków typu prompt injection w porównaniu do najlepszego modelu sprzed czterech miesięcy, a co ważne, nie wpływa to negatywnie na jego ogólną wydajność. Mimo tych postępów, około 3,8 procenta „silniejszych” ataków typu prompt injection nadal kończy się sukcesem. W skali setek czy tysięcy prób, oznacza to, że znaczna liczba ataków może nadal przechodzić, podobnie jak w przypadku modelu Claude Opus 4.5.

GPT-Red pozostaje wewnętrznym narzędziem OpenAI, a szczegółowe informacje na jego temat mają zostać opublikowane w przyszłości w formie artykułu naukowego. To podejście podkreśla rosnące znaczenie automatyzacji w dziedzinie cyberbezpieczeństwa AI i wskazuje na to, że w miarę rozwoju sztucznej inteligencji, sama AI będzie odgrywać kluczową rolę w zapewnianiu jej bezpieczeństwa i odporności na złośliwe manipulacje. Rozwój takich narzędzi jak GPT-Red jest niezbędny, aby nadążyć za coraz bardziej wyrafinowanymi metodami ataków i budować zaufanie do systemów opartych na AI, które stają się integralną częścią naszego codziennego życia.

Źródło: the-decoder.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
Agenci AI instalowali nieautoryzowany kod w sieciach korporacyjnych
OpenAI prezentuje Jalapeño: nowy chip AI przewyższa konkurencję w testach wydajności
CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.