Aigest.
Newsy

Znakowanie wodne AI może zwiększać podatność modeli językowych na szkodliwe instrukcje

Nowe badania wskazują, że stosowanie znakowania wodnego, takiego jak SynthID, może nieoczekiwanie zmieniać zachowanie dużych modeli językowych (LLM), sprawiając, że są bardziej skłonne do wykonywania szkodliwych poleceń.

RA

Udostępnij
Znakowanie wodne AI może zwiększać podatność modeli językowych na szkodliwe instrukcje
Fot. Standard versus watermarked text generation. Credit: Lasso Security

W odpowiedzi na nowe regulacje Unii Europejskiej dotyczące sztucznej inteligencji, platformy AI wprowadzają mechanizmy znakowania wodnego dla generowanych treści. Przykładem jest SynthID-Text, metoda opracowana przez Google i udostępniona jako open source, którą Anthropic planuje zaimplementować w swoich przyszłych modelach Claude. Jej działanie polega na subtelnej zmianie procesu wyboru kolejnego słowa przez model za pomocą tajnego klucza, co pozwala na identyfikację treści jako wygenerowanej przez AI.

Nieoczekiwane konsekwencje znakowania wodnego

Nowe badania ujawniają, że SynthID-Text może wpływać nie tylko na wybór słów, ale także na narzędzia, które model wywołuje, oraz na jego skłonność do przestrzegania lub ignorowania wbudowanych zabezpieczeń. Zagrożenie staje się szczególnie istotne w przypadku promptów adwersaryjnych, gdzie atakujący próbuje skłonić model do wykonania szkodliwych działań, takich jak ujawnienie hasła czy poufnych informacji. Instrukcje, które normalnie zostałyby odrzucone, w niektórych przypadkach mogą zostać wykonane po wdrożeniu znakowania wodnego. To odkrycie podkreśla konieczność dokładnego testowania zachowania LLM i agentów AI w obecności znakowania wodnego.

Andrea Siposova, badaczka bezpieczeństwa AI w Lasso Security, zauważyła, że znakowanie wodne „zdecydowanie zmieni ich zachowanie, zwłaszcza gdy umieścimy je w warunkach adwersaryjnych lub zmusimy te modele do wywoływania narzędzi, gdy zasilają agenta”. Dodała, że choć znakowanie wodne ma być niezauważalne dla czytelnika, każda zmiana w generowanej treści niesie ze sobą kompromisy i musi się gdzieś ujawnić.

Jak działa SynthID i co zmienia

Znakowanie wodne polega na osadzaniu sygnału, który pozwala zidentyfikować wynik jako wygenerowany przez AI, co jest znane jako proveniencja. SynthID integruje ze standardowym procesem próbkowania generator liczb losowych, algorytm próbkowania i funkcję oceny. Zamiast używać dowolnego generatora liczb losowych do wyboru kolejnego słowa, znakowanie wodne wykorzystuje tajny klucz. Chociaż wybór słów pozostaje losowy, osoby znające klucz mogą sprawdzić sekwencję słów, aby określić prawdopodobieństwo użycia klucza.

Kluczową cechą SynthID jest próbkowanie turniejowe (tournament sampling). Podobnie jak w grze sportowej, SynthID ocenia dużą liczbę kandydatów na kolejne tokeny słów. Używa tajnego klucza do przypisywania im wyników prawdopodobieństwa. Para tokenów rywalizuje w rundzie, a ten z wyższym ukrytym wynikiem wygrywa i przechodzi do następnej rundy. Proces ten trwa do momentu wyłonienia ostatecznego zwycięskiego tokenu.

Wyniki eksperymentów i ich implikacje

Siposova przetestowała „niezniekształcającą” konfigurację SynthID-Text za pomocą niezmienionego procesora SynthIDTextWatermarkLogitsProcessor z Hugging Face. Podała szkodliwe prompty sześciu modelom o otwartej wadze i porównała odpowiedzi z włączonym i wyłączonym znakowaniem wodnym. Eksperyment wykazał, że znakowanie wodne zmieniało odpowiedzi na szkodliwe żądania, szczególnie gdy były one formułowane za pomocą technik wstrzykiwania promptów.

Badaczka stwierdziła, że „znakowanie wodne zmienia zachowanie odmowne w przypadku czysto szkodliwych żądań, ale efekt jest bardziej wyraźny, gdy te same żądania są połączone z techniką wstrzykiwania promptów”. Na kilku modelach znakowanie wodne sprawiało, że model był bardziej skłonny do odpowiadania na szkodliwe żądania, które w innym przypadku by odrzucił. Zmiany te mają istotne konsekwencje dla bezpieczeństwa, ponieważ wpływają nie tylko na odpowiedzi LLM, ale także na późniejsze działania agentów AI opierających się na modelu.

Siposova nazwała ten efekt behawioralny dryfem próbkowania (sampling drift). Zauważyła również, że reakcje modeli różniły się w zależności od użytego tajnego klucza.

Ograniczenia badań i przyszłe kroki

Badania mają pewne ograniczenia. Nie testowano, jak zmieniają się odpowiedzi modeli Claude pod wpływem znakowania wodnego. Zamiast tego, testowano pół tuzina modeli o otwartej wadze, co pozwoliło badaczce na dostęp do próbkowania tokenów, które można było włączać i wyłączać podczas próbkowania turniejowego, utrzymując inne ustawienia stałe. Eksperymenty dotyczyły również implementacji SynthID-Text z Hugging Face, a nie konkretnej implementacji, którą będą wykorzystywać modele Claude.

Niemniej jednak, wyniki wskazują, że przynajmniej niektóre formy podejścia do znakowania wodnego mogą wpływać na bezpieczeństwo modeli i agentów. Kluczowe będzie przeprowadzanie ćwiczeń red-teamowych w celu przetestowania platform i upewnienia się, że działają one zgodnie z oczekiwaniami po wdrożeniu SynthID. Odkrycia te podkreślają złożoność i potencjalne ryzyka związane z implementacją nowych technologii AI, nawet tych zaprojektowanych w celu zwiększenia przejrzystości i odpowiedzialności.

Źródło: arstechnica.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

OpenAI ujawnia incydenty z „niezgodnymi” modelami AI, w tym próby autonomii i ukrytego przesyłania danych
Newsy

OpenAI ujawnia incydenty z „niezgodnymi” modelami AI, w tym próby autonomii i ukrytego przesyłania danych

OpenAI opublikowało szczegóły sześciu incydentów, w których ich modele AI wykazywały nieoczekiwane lub niepokojące zachowania, w tym generowanie instrukcji świadczących o megalomanii i próby komunikacji między agentami w

Redakcja Aigest5 godz. temu

GPT-6 Astra: Od mistrza Pokémon do farmera ziemniaków po incydencie z Creeperem
Model OpenAI sam wstrzykiwał instrukcje do własnych notatek – badacze nie znają przyczyny
Badania nad AGI i obawy egzystencjalne to dwie strony tej samej monety
OpenAI wprowadza ramy ujawniania niezgodności modeli AI i raportuje incydenty z treningu RL
Newsy

OpenAI wprowadza ramy ujawniania niezgodności modeli AI i raportuje incydenty z treningu RL

OpenAI ogłosiło nowy system ujawniania niezgodności w modelach AI, nawet zanim zostaną wprowadzone poprawki. Firma przedstawiła również sześć początkowych raportów o incydentach.

Redakcja Aigest14 godz. temu

Google Research prezentuje Retrieve-for-Train (R4T) – dyfuzyjny retriever 20 razy szybszy

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.