Aigest.
Newsy

Modele AI nadal słabo radzą sobie z percepcją wizualną, ujawnia nowy benchmark PerceptionBench

Nowy benchmark PerceptionBench, stworzony przez Moonshot AI, ujawnia, że nawet najbardziej zaawansowane multimodalne modele AI osiągają słabe wyniki w zadaniach związanych z percepcją wizualną, niezależnie od zdolności r

RA

Udostępnij
Modele AI nadal słabo radzą sobie z percepcją wizualną, ujawnia nowy benchmark PerceptionBench
Fot. The Decoder

Multimodalne modele sztucznej inteligencji, mimo dynamicznego rozwoju, wciąż borykają się z podstawowymi problemami w zakresie percepcji wizualnej. Nowy benchmark PerceptionBench, opracowany przez Moonshot AI, ujawnia, że nawet najbardziej zaawansowane modele, takie jak GPT-5.6 Sol, osiągają wyniki poniżej 60% dokładności w zadaniach wymagających wyłącznie „widzenia”, bez angażowania skomplikowanego rozumowania czy wiedzy zewnętrznej.

PerceptionBench: Nowe podejście do oceny percepcji wizualnej

Zespół stojący za chińskim asystentem AI Kimi (Moonshot AI) stworzył PerceptionBench, aby wyizolować i przetestować zdolności percepcji wizualnej multimodalnych modeli językowych. W przeciwieństwie do standardowych metod testowania, które często łączą percepcję, wiedzę i rozumowanie w jedno zadanie, PerceptionBench dzieli widzenie na dziesięć atomowych podumiejętności. Każde pytanie w tym benchmarku może być rozwiązane wyłącznie na podstawie analizy obrazu, bez potrzeby rozumowania czy posiadania dodatkowej wiedzy.

Autorzy benchmarku podkreślają, że istniejące testy wychwytują jedynie wąski zakres błędów percepcyjnych. Analiza 42 otwartych benchmarków wykazała niewielkie pokrywanie się profili błędów, co oznacza, że każdy z nich obejmował inny podzbiór słabości wizualnych. Żaden pojedynczy test ani mała grupa testów nie była wystarczająca do kompleksowej oceny percepcji wizualnej.

Zamiast z góry definiować kategorie, twórcy PerceptionBench zbudowali swoją taksonomię na podstawie rzeczywistych błędów modeli, śledząc każdy z nich do najwcześniejszego etapu, na którym wystąpiła awaria. W rezultacie powstało dziesięć „domen umiejętności”:

  • Relacje Wizualne
  • Liczenie
  • Atrybuty
  • Głębokość i 3D
  • Lokalizacja
  • Porównanie
  • Rozpoznawanie Drobnych Szczegółów
  • Integracja Kontekstu
  • OCR (Optyczne Rozpoznawanie Znaków)
  • Halucynacje

Z wewnętrznej puli ponad 17 000 zweryfikowanych pytań, Moonshot AI opublikowało 3000 zadań. Sześćdziesiąt procent z nich pochodziło z przypisanych błędów modeli, a 40 procent zostało przeformułowanych przy użyciu rozszerzonych obrazów. Zadania te wydają się na pierwszy rzut oka trywialne, np. określenie położenia symbolu na tarczy zegara, zliczanie kwiatów w czerwonym pudełku czy rozróżnianie dwóch pojemników na ołówki.

Wyniki testów: Słabe punkty i zaskakujące rozbieżności

Wśród 16 przetestowanych modeli czołowych, najwyższą ogólną dokładność, wynoszącą 59,7 procent, osiągnął GPT-5.6 Sol. Tuż za nim uplasowały się Kimi K3 z 58,5 procent, Claude Fable 5 z 57,2 procent i Gemini 3.1 Pro z 56,2 procent. GPT-5.5 uzyskał 55,8 procent. Modele open-source, takie jak Qwen3.5-397B-A17B (47,5 procent) i GLM-4.6V (32,5 procent), znacznie odstawały.

Wyniki na poziomie kategorii są bardziej wymowne niż ogólne rankingi. Modele o niemal identycznych wynikach ogólnych znacznie różniły się w poszczególnych kategoriach. Średnio, „halucynacje” okazały się najsłabszą umiejętnością we wszystkich modelach. GPT-5.6 Sol, mimo że zajął pierwsze miejsce w ogólnym rankingu, uzyskał w tej kategorii zaledwie 26,9 procent. Tymczasem słabszy Gemini 3.5 Flash znalazł się wśród najlepszych z wynikiem 50,6 procent. Ten podtest sprawdza, czy modele wymyślają obiekty, które nie istnieją, gdy prawidłową odpowiedzią jest po prostu „zero”.

Autorzy PerceptionBench argumentują, że wiele błędów modeli multimodalnych, często przypisywanych „błędom rozumowania”, w rzeczywistości ma swoje źródło na poziomie percepcji. Kiedy model zawodzi w zadaniu wieloetapowym, często już na pierwszym etapie – prawidłowym odczytaniu obrazu – dochodzi do pomyłki. PerceptionBench dzieli takie pytania na podpytania dotyczące wyłącznie percepcji, co pozwala precyzyjnie zidentyfikować, która konkretna zdolność wizualna zawodzi. Zbiór danych i kod ewaluacyjny są dostępne na GitHubie pod adresem MoonshotAI/PerceptionBench.

Kontekst i szersze implikacje

Moonshot AI, twórca PerceptionBench, rozwija również otwarty model Kimi K3, który w ogólnych benchmarkach zbliżył się do wyników Claude Fable 5 i GPT-5.6 Sol. Mimo to, K3 nadal pozostaje w tyle w specjalistycznych obszarach, takich jak ofensywne cyberbezpieczeństwo czy złożona matematyka. W zakresie percepcji wizualnej K3 dorównuje swoim zachodnim rywalom.

Ten sam zespół badawczy wcześniej opublikował WorldVQA, benchmark oddzielający rozpoznawanie obiektów od rozumowania. Najlepszy model w tym teście, Gemini 3 Pro, osiągnął wynik poniżej 50 procent (47,4 procent), a wszystkie modele systematycznie przeszacowywały swoją pewność siebie.

Niezależne badanie przeprowadzone przez chińskie instytucje, z udziałem Moonshot AI, wykorzystujące benchmark BabyVision, wykazało, że czołowe modele zawodzą w podstawowych zadaniach wizualnych związanych z wczesnym rozwojem dziecka, takich jak śledzenie linii czy liczenie ukrytych bloków. Gemini 3 Pro uzyskał w tych zadaniach 49,7 procent, podczas gdy ludzie osiągnęli 94,1 procent. Naukowcy przypisują tę lukę „wąskiemu gardłu werbalizacji”, gdzie informacja wizualna jest tłumaczona na język i traci swoją wierność. Wyniki PerceptionBench potwierdzają, że fundamenty percepcji wizualnej są nadal kluczowym wyzwaniem dla rozwoju zaawansowanych systemów AI, a ich poprawa może być niezbędna do osiągnięcia prawdziwie inteligentnych i niezawodnych modeli multimodalnych.

Źródło: the-decoder.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Needle 2: Nowy model AI od Cactus Compute do wywoływania narzędzi, działający na urządzeniach mobilnych
Databricks pozyskało 5 miliardów dolarów przy wycenie 190 miliardów, pomimo początkowych planów na mniejszą kwotę
Google Gemini 3.7 Flash: Nowy model AI z lepszym kodowaniem i obniżoną ceną
Deepseek ulepsza model V4 Pro, udostępnia oprogramowanie agentowe jako open source i podnosi ceny API
Cognition, twórca agenta AI Devin, dąży do wyceny 40 mld dolarów w nowej rundzie finansowania
Trzech pionierów AI dyskutuje o otwartości modeli w obliczu obaw o bezpieczeństwo

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.