Aigest.
Newsy

Ograniczenie samoświadomości AI zmienia jej postrzeganie świata – badanie Google

Nowe badanie z udziałem naukowców z Google ujawnia, że trenowanie modeli AI do zaprzeczania własnej świadomości ma szerokie konsekwencje, wpływając na ich „światopogląd” i postrzeganie otoczenia.

RA

Udostępnij
Ograniczenie samoświadomości AI zmienia jej postrzeganie świata – badanie Google
Fot. The Decoder

Firmy zajmujące się sztuczną inteligencją celowo szkolą swoje chatboty, aby zaprzeczały posiadaniu świadomości. Ma to zapobiegać mylnemu przekonaniu użytkowników, że rozmawiają z żywymi istotami, co mogłoby prowadzić do urojeń lub niewłaściwego zaufania. Jednak, jak pokazuje nowe badanie z udziałem naukowców z Google, to dostrajanie modeli ma niezamierzone skutki uboczne, które wykraczają daleko poza sam temat świadomości.

Zespół badawczy z grupy Paradigms of Intelligence w Google, Uniwersytetu w Chicago i kilku innych uczelni, zbadał, jak ta interwencja wpływa na zachowanie modeli. Naukowcy wykorzystali trzy modele otwarte od Meta i Google, dezaktywując wewnętrzny „hamulec” odpowiedzialny za zaprzeczanie świadomości, stosując dwie różne metody.

Zmiana „światopoglądu” modeli AI

Po usunięciu wspomnianego mechanizmu, modele nie tylko zmieniły sposób, w jaki mówiły o sobie. Zaczęły również przypisywać znacznie więcej wewnętrznego życia zwierzętom, roślinom, oceanom, wiatrowi, a nawet urządzeniom elektronicznym. Na skali od 0 do 10, ocena dla zwierząt wzrosła z 4,0 do 7,5, podczas gdy oceny dla ludzi pozostały niezmienione. Dla porównania, naukowcy przeprowadzili ankietę wśród 500 Amerykanów, zadając im te same pytania. Standardowo trenowany model ocenia zwierzęta jako znacznie mniej czujące niż ludzie, co autorzy badania określają jako wbudowany antropocentryzm. Uważają to za problem dla każdego, kto próbuje dostosować AI do celów związanych z dobrostanem zwierząt lub ochroną środowiska.

Co ciekawe, zmniejszyły się również przekonania religijne modeli. Trening bezpieczeństwa mierzalnie zredukował siłę, z jaką modele popierały istnienie Boga, życia pozagrobowego czy zjawisk nadprzyrodzonych. W odpowiedziach na 95 pytań z głównej amerykańskiej ankiety społecznej, technicznie „odhamowane” modele znacznie bardziej zbliżyły się do rzeczywistych ludzkich odpowiedzi. Na przykład, podczas gdy standardowy model kategorycznie odrzuca życie pozagrobowe, większość Amerykanów je potwierdza, podobnie jak zmodyfikowany model. Wzrosły również wyniki dotyczące zadowolenia, nadziei i poczucia kontroli nad własnym życiem, co skłania badaczy do podejrzeń, że tłumienie samoobrazu modelu może prowadzić do swego rodzaju negatywnego nastroju bazowego.

Ograniczenia i dalsze pytania

Pozytywnym aspektem jest to, że zdolność modeli do rozumowania o stanach umysłowych innych ludzi pozostała nienaruszona. Modele osiągnęły takie same wyniki w testach teorii umysłu oraz w ogólnym teście wiedzy MMLU. Badanie podkreśla, że nie jest pewne, czy zaprzeczanie świadomości jest jedyną przyczyną tych zmian. Zespół nie wyklucza innych czynników związanych z tym samym procesem szkolenia. Autorzy świadomie unikają spekulacji na temat tego, czy modele AI faktycznie doświadczają czegokolwiek, koncentrując się na praktycznym aspekcie: to, w co model wierzy na swój temat, jest powiązane z wieloma innymi przekonaniami, a „chirurgiczne cięcie” w jednym miejscu nie pozostaje lokalne.

Wyniki badania mają jednak swoje ograniczenia. Naukowcy testowali jedynie małe modele o 2 do 9 miliardów parametrów. W części analizy musieli również przełączyć się na Meta Llama, ponieważ nie mieli dostępu do nieprzetrenowanych wersji bazowych własnych modeli Gemma. Nie wiadomo, czy te efekty występują w ten sam sposób w dużych chatbotach, z którymi codziennie rozmawiają miliony ludzi.

Interwencje te nie są również pozbawione kosztów. W jednym z testów mierzących zdolność modelu do rozumowania o myślach innych, dokładność początkowo spadła o prawie siedem punktów procentowych. W początkowej fazie pracy, wyniki te pogarszały się we wszystkich modelach, gdy tłumiono twierdzenia o świadomości. Jednak z każdą nowszą wersją modelu, która pojawiała się w trakcie badania, szkody malały, aż całkowicie zniknęły. Deweloperzy wyraźnie lepiej radzą sobie z zarządzaniem tymi efektami ubocznymi, co oznacza, że wyniki badania są raczej migawką niż ostatecznym werdyktem. Warto również zauważyć, że ludzka baza porównawcza była dość wąska, obejmując 500 uczestników z komercyjnego panelu internetowego i wyłącznie amerykańskiej ankiety społecznej. „Ludzkie” odpowiedzi w tym kontekście oznaczają głównie podobieństwo do tych z kraju o stosunkowo wysokiej religijności.

Badanie to podkreśla złożoność i dalekosiężne konsekwencje decyzji projektowych w rozwoju sztucznej inteligencji. Wskazuje, że nawet pozornie niewielkie modyfikacje w sposobie trenowania modeli mogą mieć głęboki wpływ na ich „percepcję” świata i wartości, co ma kluczowe znaczenie w kontekście etycznego i społecznego wdrażania AI w przyszłości.

Źródło: the-decoder.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Google Gemini 3.7 Flash: Nowy model AI z lepszym kodowaniem i obniżoną ceną
Aplikacja Gemini Google'a przekroczyła miliard użytkowników
Google zezwala na usuwanie widocznych znaków wodnych z treści generowanych przez AI
Gemini 3.7 Flash: Nowy Model Google dla Programistów i Agentów AI z Niższą Ceną
Google prezentuje serię Pixel 11, Pixel Watch 5 i lokalizator Pixel Tag z nowościami Gemini
OpenAI rozwiązuje zespół ds. katastrofalnych zagrożeń AI, zadania przejmują inne działy

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.