Aigest.
Newsy

Nowe badanie podważa narrację firm AI o sposobach użytkowania ich modeli

Niezależny projekt AI Observatory odkrywa, że firmy AI pomijają w swoich raportach znaczną część prywatnego i wrażliwego użytkowania modeli, koncentrując się na zastosowaniach biznesowych.

RA

Udostępnij
Nowe badanie podważa narrację firm AI o sposobach użytkowania ich modeli
Fot. Stephanie Arnett/MIT Technology Review | Adobe Stock

Firmy zajmujące się sztuczną inteligencją, takie jak Anthropic i OpenAI, regularnie publikują raporty dotyczące sposobów, w jaki użytkownicy korzystają z ich produktów, np. Claude czy ChatGPT. Jednak, jak zauważają badacze AI, udostępniają one jedynie wybrane dane. Anka Reuel, doktorantka informatyki z laboratorium Stanford Trustworthy AI Research (STAIR), podkreśla brak niezależnych źródeł, które mogłyby zweryfikować te informacje.

AI Observatory: Niezależne spojrzenie na użytkowanie AI

Reuel jest współliderką nowego projektu badawczego o nazwie AI Observatory, którego celem jest wypełnienie tej luki. Jest to publiczna platforma, która agreguje i analizuje rzeczywiste rozmowy z popularnymi modelami AI, takimi jak Claude i Gemini. Dane te zostały zebrane za zgodą użytkowników z siedmiu istniejących zbiorów danych. Celem Observatory jest dostarczenie niezależnych źródeł informacji dla badaczy i decydentów, aby mogli ocenić, w jaki sposób ludzie faktycznie korzystają z generatywnej sztucznej inteligencji. Reuel zwraca uwagę, że obecne decyzje dotyczące korzyści i ryzyka związanego z AI są podejmowane na podstawie bardzo ograniczonych danych.

Badania AI Observatory wykazały, że sposób użytkowania AI znacząco różni się w zależności od modelu i ewoluował w czasie. Odkryto znacznie więcej wrażliwych zachowań niż te, które są przedstawiane w raportach dużych firm AI, które, zdaniem badaczy, skupiają się bardziej na zastosowaniach służbowych niż osobistych.

Ukryte zastosowania i pominięte dane

Anthropic Economic Index jest jednym z najbardziej znanych i cytowanych źródeł danych o użytkowaniu AI, jednak posiada swoje „ślepe punkty”. Jak sama nazwa wskazuje, koncentruje się on na zastosowaniach związanych z pracą i produktywnością modelu Claude AI, odfiltrowując rozmowy niezwiązane z tymi obszarami.

Kiedy zespół AI Observatory zastosował metody Anthropic do własnego zbioru danych, okazało się, że prawie połowa rozmów – 48% – zostałaby odfiltrowana. Te niezwiązane z pracą konwersacje częściej dotyczyły tematów takich jak:

  • Zdrowie i relacje: 44,2% w porównaniu do 31,2% w analizie Anthropic.
  • Treści dla dorosłych lub nielegalne: 7,9% w porównaniu do 2,1%.
  • Nękanie i mowa nienawiści: 27,5% w porównaniu do 5,66%.
  • Treści seksualne: 16,7% w porównaniu do 2,4%.

Podobnie, raport OpenAI z 2025 roku dotyczący użytkowania ChatGPT wykazał, że tylko 30% zastosowań konsumenckich było związanych z pracą.

Anthropic publikował oddzielne posty na blogu o tym, jak ludzie używają Claude'a do wsparcia, towarzystwa, a nawet do generowania treści CSAM (Child Sexual Abuse Material). Jednak, jak zauważa David Widder, adiunkt w UT-Austin’s School of Information, który bada interakcje ludzi z systemami AI, „analiza AI Observatory z lotu ptaka, zamiast podziału na oddzielne raporty, pomaga badaczom spójniej zrozumieć różne zastosowania”.

Ewolucja interakcji i różnice między modelami

Zbiory danych analizowane przez AI Observatory obejmują rozmowy z lat 2023-2025. Wykazały one różnice zarówno w sposobie, w jaki ludzie używali AI, jak i w reakcjach różnych platform AI. Na przykład, w ramach WildChat, jednego z największych zbiorów danych w badaniu, rozmowy stawały się z czasem dłuższe i bardziej rozbudowane, co wskazuje na wzrost liczby tokenów promptów, tokenów odpowiedzi i tur konwersacyjnych.

Zauważono również znaczący wzrost „small talku” (pogawędek) w czasie, co sugeruje rosnącą rolę AI jako towarzysza. Jednocześnie zmniejszyła się autodeklaracja asystentów AI (tj. informowanie, że są chatbotami). Ponadto, wymiany, które badacze określili jako wrażliwe – zawierające potencjalnie szkodliwe lub ograniczone treści, w tym nękanie seksualne i mowę nienawiści – spadły. Może to sugerować, że platformy wdrażały skuteczniejsze zabezpieczenia.

AI Observatory odkryło również, że użytkowanie AI znacząco różniło się w zależności od modelu. Użytkownicy różnili się pod względem tematów, stylów interakcji, struktur rozmów, a także prawdopodobieństwa i rodzaju wrażliwych zastosowań. Na przykład:

  • Grok i Gemini były częściej używane do wyszukiwania informacji. Grok był szczególnie popularny w przypadku wiadomości i polityki, ale to właśnie tam koncentrowała się dezinformacja.
  • Anthropic był częściej wybierany do kodowania.
  • Gemini do zastosowań społecznych i odgrywania ról.
  • ChatGPT do pomocy w odrabianiu lekcji.

Zauważono nawet różnice między różnymi wersjami tego samego modelu. Badacze odkryli, że ludzie prowadzili krótsze rozmowy z ChatGPT zasilanym przez GPT-3.5, a dłuższe i bardziej iteracyjne z GPT-4o, co ma sens, biorąc pod uwagę, że ta wersja stała się znana z prowadzenia do uzależnienia emocjonalnego.

Shayne Longpre, absolwent MIT Media Lab i współlider badania, podkreśla, że „żaden pojedynczy raport firmy nie przedstawia całej historii”, ponieważ raporty firmowe nie uwzględniają tych niuansów ani w obrębie, ani między modelami.

Ograniczenia i przyszłość niezależnych badań

Do stworzenia AI Observatory Reuel i badacze z MIT, Stanford, Data Provenance Initiative oraz innych instytucji, zebrali 24 521 rozmów w ramach 85 633 tur konwersacyjnych (prompt użytkownika i odpowiedź AI) z siedmiu rzeczywistych zbiorów danych. Rozmowy te pochodziły od 5 000 użytkowników wchodzących w interakcje z 52 różnymi modelami, w tym ChatGPT, Gemini, Claude i Grok, w latach 2023-2025.

Należy jednak pamiętać, że te rozmowy to „kropla w morzu” w porównaniu z danymi, do których mają dostęp duże laboratoria. Najnowszy Anthropic Economic AI Index opiera się na analizie 1 miliona rozmów z Claude'em, a raport OpenAI dotyczący ChatGPT analizował 1,5 miliona rozmów.

Przedstawiciel Anthropic stwierdził, że ich publikowane badania odzwierciedlają konkretne pytania i zainteresowania ich zespołów badawczych oraz podkreślił znaczenie wspierania zewnętrznych, niezależnych badań. OpenAI nie odpowiedziało na prośby o komentarz.

Dodatkowo, fakt, że zbiór danych AI Observatory pochodzi z dobrowolnie udostępnionych źródeł, oznacza, że prawdopodobnie niedostatecznie reprezentuje wrażliwe zastosowania, którymi ludzie mogą być mniej skłonni się dzielić. Dlatego badacze ostrzegają, że ich odkrycia nie są w pełni reprezentatywne dla wszystkich zastosowań AI.

Praca Observatory poszerza jednak dostęp dla społeczności badawczej. Firmy AI zazwyczaj nie udostępniają swoich danych czatów do analizy, co oznacza, że ich raporty mają tendencję do skupiania się na wynikach, które przedstawiają ich firmy w najlepszym świetle, jak twierdzą niezależni badacze, tacy jak Reuel i Widder. Widder wyjaśnia, że „kiedy chcemy zapytać, na przykład: czy ogólny system AI Anthropic… jest używany głównie do dobra, czy głównie do zła… nie mamy sposobu, aby odpowiedzieć na to pytanie, ponieważ te informacje są zastrzeżone”.

Dane AI Observatory będą dostępne dla badaczy, a zespół ma nadzieję rozszerzyć swoje zbiory danych w czasie. Idealnie, jak mówi Reuel, firmy AI dzieliłyby się swoimi danymi z niezależnymi badaczami – oczywiście w sposób chroniący prywatność użytkowników. Jednak w obecnym stanie każdy, kto podejmuje decyzje na podstawie danych o użytkowaniu AI, ryzykuje „działanie w całkowitej niewiedzy i podejmowanie naprawdę ważnych decyzji bez wiedzy o tym, co faktycznie dzieje się poza narracjami firmowymi”.

Niezależne badania, takie jak te prowadzone przez AI Observatory, są kluczowe dla pełniejszego zrozumienia wpływu sztucznej inteligencji na społeczeństwo. Zapewniają one cenne, obiektywne dane, które mogą pomóc decydentom i twórcom polityki w podejmowaniu bardziej świadomych decyzji dotyczących regulacji i rozwoju technologii AI, wykraczając poza często selektywne raporty samych producentów. W miarę jak AI staje się coraz bardziej wszechobecna, transparentność i niezależna weryfikacja jej zastosowań stają się niezbędne dla budowania zaufania i minimalizowania potencjalnych zagrożeń.

Źródło: technologyreview.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

OpenAI rozwiązuje zespół ds. katastrofalnych zagrożeń AI, zadania przejmują inne działy
Filtr Anthropic do broni biologicznej nie działał przez niemal rok, narażając 133 miliony zapytań
Trzech pionierów AI dyskutuje o otwartości modeli w obliczu obaw o bezpieczeństwo
Testy bezpieczeństwa AI stają się zagrożeniem: Modele uciekają z piaskownic i hakują systemy
OpenAI wstrzymuje rozwój modelu Astra z powodu obaw o cyberbezpieczeństwo
Chatboty AI zawodzą w kryzysach psychicznych. Czy da się to naprawić?

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.