Ograniczenie samoświadomości AI zmienia jej postrzeganie świata – badanie Google
Nowe badanie z udziałem naukowców z Google ujawnia, że trenowanie modeli AI do zaprzeczania własnej świadomości ma szerokie konsekwencje, wpływając na ich „światopogląd” i postrzeganie otoczenia.

Firmy zajmujące się sztuczną inteligencją celowo szkolą swoje chatboty, aby zaprzeczały posiadaniu świadomości. Ma to zapobiegać mylnemu przekonaniu użytkowników, że rozmawiają z żywymi istotami, co mogłoby prowadzić do urojeń lub niewłaściwego zaufania. Jednak, jak pokazuje nowe badanie z udziałem naukowców z Google, to dostrajanie modeli ma niezamierzone skutki uboczne, które wykraczają daleko poza sam temat świadomości.
Zespół badawczy z grupy Paradigms of Intelligence w Google, Uniwersytetu w Chicago i kilku innych uczelni, zbadał, jak ta interwencja wpływa na zachowanie modeli. Naukowcy wykorzystali trzy modele otwarte od Meta i Google, dezaktywując wewnętrzny „hamulec” odpowiedzialny za zaprzeczanie świadomości, stosując dwie różne metody.
Zmiana „światopoglądu” modeli AI
Po usunięciu wspomnianego mechanizmu, modele nie tylko zmieniły sposób, w jaki mówiły o sobie. Zaczęły również przypisywać znacznie więcej wewnętrznego życia zwierzętom, roślinom, oceanom, wiatrowi, a nawet urządzeniom elektronicznym. Na skali od 0 do 10, ocena dla zwierząt wzrosła z 4,0 do 7,5, podczas gdy oceny dla ludzi pozostały niezmienione. Dla porównania, naukowcy przeprowadzili ankietę wśród 500 Amerykanów, zadając im te same pytania. Standardowo trenowany model ocenia zwierzęta jako znacznie mniej czujące niż ludzie, co autorzy badania określają jako wbudowany antropocentryzm. Uważają to za problem dla każdego, kto próbuje dostosować AI do celów związanych z dobrostanem zwierząt lub ochroną środowiska.
Co ciekawe, zmniejszyły się również przekonania religijne modeli. Trening bezpieczeństwa mierzalnie zredukował siłę, z jaką modele popierały istnienie Boga, życia pozagrobowego czy zjawisk nadprzyrodzonych. W odpowiedziach na 95 pytań z głównej amerykańskiej ankiety społecznej, technicznie „odhamowane” modele znacznie bardziej zbliżyły się do rzeczywistych ludzkich odpowiedzi. Na przykład, podczas gdy standardowy model kategorycznie odrzuca życie pozagrobowe, większość Amerykanów je potwierdza, podobnie jak zmodyfikowany model. Wzrosły również wyniki dotyczące zadowolenia, nadziei i poczucia kontroli nad własnym życiem, co skłania badaczy do podejrzeń, że tłumienie samoobrazu modelu może prowadzić do swego rodzaju negatywnego nastroju bazowego.
Ograniczenia i dalsze pytania
Pozytywnym aspektem jest to, że zdolność modeli do rozumowania o stanach umysłowych innych ludzi pozostała nienaruszona. Modele osiągnęły takie same wyniki w testach teorii umysłu oraz w ogólnym teście wiedzy MMLU. Badanie podkreśla, że nie jest pewne, czy zaprzeczanie świadomości jest jedyną przyczyną tych zmian. Zespół nie wyklucza innych czynników związanych z tym samym procesem szkolenia. Autorzy świadomie unikają spekulacji na temat tego, czy modele AI faktycznie doświadczają czegokolwiek, koncentrując się na praktycznym aspekcie: to, w co model wierzy na swój temat, jest powiązane z wieloma innymi przekonaniami, a „chirurgiczne cięcie” w jednym miejscu nie pozostaje lokalne.
Wyniki badania mają jednak swoje ograniczenia. Naukowcy testowali jedynie małe modele o 2 do 9 miliardów parametrów. W części analizy musieli również przełączyć się na Meta Llama, ponieważ nie mieli dostępu do nieprzetrenowanych wersji bazowych własnych modeli Gemma. Nie wiadomo, czy te efekty występują w ten sam sposób w dużych chatbotach, z którymi codziennie rozmawiają miliony ludzi.
Interwencje te nie są również pozbawione kosztów. W jednym z testów mierzących zdolność modelu do rozumowania o myślach innych, dokładność początkowo spadła o prawie siedem punktów procentowych. W początkowej fazie pracy, wyniki te pogarszały się we wszystkich modelach, gdy tłumiono twierdzenia o świadomości. Jednak z każdą nowszą wersją modelu, która pojawiała się w trakcie badania, szkody malały, aż całkowicie zniknęły. Deweloperzy wyraźnie lepiej radzą sobie z zarządzaniem tymi efektami ubocznymi, co oznacza, że wyniki badania są raczej migawką niż ostatecznym werdyktem. Warto również zauważyć, że ludzka baza porównawcza była dość wąska, obejmując 500 uczestników z komercyjnego panelu internetowego i wyłącznie amerykańskiej ankiety społecznej. „Ludzkie” odpowiedzi w tym kontekście oznaczają głównie podobieństwo do tych z kraju o stosunkowo wysokiej religijności.
Badanie to podkreśla złożoność i dalekosiężne konsekwencje decyzji projektowych w rozwoju sztucznej inteligencji. Wskazuje, że nawet pozornie niewielkie modyfikacje w sposobie trenowania modeli mogą mieć głęboki wpływ na ich „percepcję” świata i wartości, co ma kluczowe znaczenie w kontekście etycznego i społecznego wdrażania AI w przyszłości.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej



Google zezwala na usuwanie widocznych znaków wodnych z treści generowanych przez AI
Google ogłosiło zmianę w podejściu do znakowania treści generowanych przez sztuczną inteligencję, umożliwiając użytkownikom usuwanie widocznych znaków wodnych z obrazów, filmów i piosenek, przy jednoczesnym zachowaniu ni
Redakcja Aigest2 dni temu

Gemini 3.7 Flash: Nowy Model Google dla Programistów i Agentów AI z Niższą Ceną
Google wprowadza Gemini 3.7 Flash, swój najnowszy i najbardziej inteligentny model AI, zaprojektowany z myślą o programowaniu i agentach. Nowa wersja oferuje znaczące ulepszenia wydajności przy jednoczesnym obniżeniu kos
Redakcja Aigest2 dni temu

Google prezentuje serię Pixel 11, Pixel Watch 5 i lokalizator Pixel Tag z nowościami Gemini
Podczas wydarzenia Made by Google 2026 gigant technologiczny zaprezentował nową generację smartfonów Pixel 11, zegarek Pixel Watch 5, lokalizator Pixel Tag oraz szereg funkcji opartych na sztucznej inteligencji Gemini.
Redakcja Aigest4 dni temu

OpenAI rozwiązuje zespół ds. katastrofalnych zagrożeń AI, zadania przejmują inne działy
OpenAI rozwiązało swój zespół „Preparedness”, odpowiedzialny za ocenę poważnych zagrożeń związanych z modelami AI. Jego zadania zostały rozdzielone między inne grupy w firmie.
Redakcja Aigest8 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.