Problem "jednakowości" w menu generowanych przez AI: dlaczego jedzenie wygląda nienaturalnie?
Coraz częściej spotykane menu restauracyjne generowane przez sztuczną inteligencję budzą niepokój i odrazę. Problem tkwi w specyficznej estetyce, na której trenowane są modele AI, prowadzącej do nienaturalnie idealnych i

Wchodząc do kawiarni, można natknąć się na menu, którego ilustracje, choć pozornie idealne, wywołują dziwne uczucie dyskomfortu. Perfekcyjnie symetryczne, nienaturalnie gładkie grafiki jedzenia, takie jak kanapki z bajglem, stają się coraz częstszym zjawiskiem w branży gastronomicznej. To nie paranoja – to efekt generatywnej sztucznej inteligencji, która wkracza do restauracji, prezentując obrazy stworzone przez modele trenowane na wąskiej, „przyjemnej” estetyce, która w rzeczywistości wydaje się po prostu niewłaściwa.
Czasami te ilustracje są rażąco sztuczne, jak burrito z serem tak puszystym i roztopionym, że przypomina awangardowe dzieło sztuki, a nie posiłek. Częściej jednak są na tyle zwyczajne, że dopiero po dokładniejszym przyjrzeniu się zauważa się, że coś jest nie tak. Alex Lisle, CTO firmy Reality Defender, porównuje to do „obcego próbującego zrobić pizzę bez zrozumienia jej podstawowych zasad”. Firma Reality Defender jest jednym z wielu startupów oferujących narzędzia do wykrywania AI i weryfikacji treści, co podkreśla skalę problemu.
Dlaczego AI tworzy „potworności Lovecrafta”?
Lisle wyjaśnia, że sposób budowania modeli AI tłumaczy, dlaczego ilustracje przyjmują tak specyficzną estetykę. Widzimy idealnie okrągłe gałki lodów czy krewetki, które wyglądają, jakby zostały genetycznie zmodyfikowane, by zjadać własne ogony, tworząc „lovecraftowskie horrory kulinarne”.
Duże modele językowe (LLM) i modele dyfuzyjne, które napędzają chatboty takie jak ChatGPT i generatory obrazów jak Midjourney, są trenowane na ogromnych ilościach danych. Następnie identyfikują wzorce w tych zbiorach, aby przewidzieć, czego szuka użytkownik, gdy prosi o coś w rodzaju „stwórz menu dla restauracji z burgerami”. Lisle zauważa, że wiele z tych obrazów wygląda jak menu Chili’s z 2015 roku, ponieważ to właśnie z takich materiałów modele czerpały swoje funkcje.
Konwergencja i „choroba szalonych krów” AI
Nowe dane treningowe są niezwykle cenne dla firm tworzących modele AI. Na przykład Amazon skanuje rzadkie książki, by dodać je do swoich danych treningowych, a następnie niszczy oryginały. Nieuniknione jest, że część treści generowanych przez AI przeniknie do tych ogromnych zbiorów danych. Jednak gdy modele AI trenują się na zbyt dużej ilości własnych treści, ryzykują załamanie modelu (model collapse).
Lisle porównuje załamanie modelu do „choroby szalonych krów”, gdzie „karmienie modelu jego własnymi wynikami prowadzi do zbyt dużego chowu wsobnego, a w końcu całość się załamuje”. To, co obserwujemy w przypadku menu, to konwergencja, która jest mniej ekstremalna. Powoduje ona degradację jakości wyników AI, ale nie czyni modelu całkowicie bezużytecznym. Jeśli model AI ma wygenerować menu dla restauracji fast food, prawdopodobnie odwoła się do menu Wendy’s, Burger Kinga czy McDonald’s. Te menu już mają podobny styl, co oznacza, że wyniki AI będą go naśladować, a jeśli te generowane menu trafią z powrotem do danych treningowych, styl ten zostanie jeszcze bardziej wzmocniony.
Efekt „doliny niesamowitości” i utrata autentyczności
Lee Rainie, dyrektor Imagining the Digital Future Center na Elon University, zauważa, że optymalizacja zbiorów danych pod kątem „przyjemności” i „nieobrażania” prowadzi do homogenizacji. AI, zarówno w obrazach, jak i języku, ma tendencję do „ścinania krawędzi”, czyli usuwania unikalnych cech. Ten efekt wygładzania obrazów nasila się, gdy użytkownik wielokrotnie edytuje menu generowane przez AI. Użytkownik Labtec na platformie X pokazał, jak menu stworzone w ChatGPT i edytowane 100 razy staje się coraz mniej podobne do prawdziwego jedzenia, co ostatecznie wywołuje dyskomfort.
Restauracje, poprawiając drobne szczegóły, takie jak ceny czy nazwy pozycji, nieświadomie pogłębiają ten problem, a obrazy jedzenia stają się coraz bardziej okrągłe i gładkie. Ludzie mają niemal niewytłumaczalne poczucie, kiedy patrzą na coś wygenerowanego przez AI, a kiedy na coś prawdziwego. Badacze z Uniwersytetu Duisburg-Essen w Niemczech odkryli, że obrazy jedzenia generowane przez AI wywołują efekt „doliny niesamowitości”, gdzie obrazy niemal realistyczne budzą większy niesmak i niepokój niż te ewidentnie sztuczne. Ta niechęć nasila się w kontekście kulturowym wokół AI.
Negatywna reakcja ludzi na te obrazy jest wystarczającym powodem, by restauracje przestały próbować wdrażać menu generowane przez AI. Jednak problemy związane z perfekcyjnie zarumienionymi bułkami hamburgerowymi wykraczają poza stół obiadowy. Alex Lisle podkreśla, że „widzenie i słyszenie zawsze było wierzeniem, do tego stopnia, że nawet nasze systemy sądowe są całkowicie nastawione na to, że złotym standardem dowodów są nagrane zeznania i dowody wideo”. W dobie AI „to już nie jest prawdą. Świat fundamentalnie się zmienił, na dobre lub na złe”. To zjawisko pokazuje, jak głęboko sztuczna inteligencja wpływa na nasze postrzeganie rzeczywistości i zaufanie do obrazu, co ma konsekwencje daleko wykraczające poza branżę gastronomiczną.
Źródło: techcrunch.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Crusoe pozyskuje 3 mld dolarów finansowania, osiągając wycenę 30 mld dolarów
Firma Crusoe, dostawca infrastruktury AI i centrów danych, pozyskała 3 miliardy dolarów w nowej rundzie finansowania, co podniosło jej wycenę do 30 miliardów dolarów.
Redakcja Aigest8 godz. temu

Google DeepMind prezentuje WeatherNext 3 – nowy model AI do prognozowania pogody
Google DeepMind i Google Research wprowadziły WeatherNext 3, zaawansowany model sztucznej inteligencji, który ma zrewolucjonizować prognozowanie pogody, oferując większą dokładność i częstotliwość aktualizacji.
Redakcja Aigest18 godz. temu

NeoMME: Nowy, wydajny enkoder multimodalny i wielojęzyczny
Hugging Face przedstawia NeoMME, innowacyjny enkoder multimodalny i wielojęzyczny, który efektywnie przetwarza tekst, obrazy i dźwięk, oferując jednocześnie wysoką wydajność i wszechstronność w różnych zadaniach AI.
Redakcja Aigest19 godz. temu

Google wprowadza Gemini 3.8 Flash, trzeci model Flash w sześć tygodni
Google zaprezentowało Gemini 3.8 Flash, swój trzeci model Flash w ciągu zaledwie sześciu tygodni, oferując ulepszone możliwości rozumowania i kodowania, a także specjalistyczną wersję Cyber do wykrywania luk.
Redakcja Aigestwczoraj

CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
Max Spero, CEO firmy Pangram, ostrzega przed rosnącym problemem zaufania w internecie, wynikającym z powszechnego użycia treści generowanych przez sztuczną inteligencję. Jego firma oferuje narzędzia do wykrywania AI, aby
Redakcja Aigestwczoraj

Amazon wykorzystuje AI do walki z oszustwami, Alexa pomoże rozpoznać scamy
Amazon wprowadza nowe funkcje oparte na sztucznej inteligencji, aby pomóc klientom w identyfikacji fałszywych wiadomości i oszustw. Usługa Alexa for Shopping będzie teraz w stanie potwierdzić autentyczność komunikacji od
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.