Aigest.
Newsy

Deepseek prezentuje eksperymentalny model wizyjny Flash, konkurujący z Opus 4.8 w testach agentowych

Chińska firma Deepseek wprowadziła na rynek V4-Flash-Vision-Exp, eksperymentalny model multimodalny, który rozszerza możliwości tekstowe o rozumienie obrazów. Według wewnętrznych testów Deepseek, model ten niemal dorównu

RA

Udostępnij
Deepseek prezentuje eksperymentalny model wizyjny Flash, konkurujący z Opus 4.8 w testach agentowych
Fot. The Decoder

Chińska firma Deepseek ogłosiła wydanie V4-Flash-Vision-Exp, eksperymentalnego modelu multimodalnego, który wzbogaca dotychczasowe możliwości tekstowe o rozumienie obrazów. Według wewnętrznych testów Deepseek, nowy model niemal dorównuje Opus 4.8 w zadaniach agentowych, co stanowi znaczący krok w rozwoju technologii sztucznej inteligencji.

Rozszerzone możliwości i zastosowania

Model Deepseek-V4-Flash-Vision-Exp rozszerza funkcjonalność Deepseek-V4-Flash o przetwarzanie obrazów, jednocześnie zachowując wysoką wydajność bazowego modelu w zakresie rozumowania i wiedzy ogólnej. Deepseek pozycjonuje ten model jako narzędzie do zastosowań opartych na agentach, projektując go do współpracy z różnymi frameworkami agentowymi. Jego kluczową cechą jest zdolność do łączenia rozumienia wizualnego z wykorzystaniem narzędzi. W praktyce model może opisywać obrazy, wyodrębniać tekst ze zrzutów ekranu oraz analizować diagramy. Obsługuje popularne formaty plików graficznych, takie jak JPEG, PNG, GIF i WebP, a co istotne, określa format na podstawie rzeczywistej zawartości pliku, a nie nazwy czy deklarowanego typu MIME, zgodnie z dokumentacją API.

Integracja i elastyczność dla deweloperów

Model jest kompatybilny z API OpenAI Chat Completions i Responses oraz z punktem końcowym Anthropic Messages, co ułatwia jego integrację z istniejącymi platformami. Deepseek udostępnił również wersję 0.1.1 swojego frameworka Harness, który od razu wspiera nowy model. Deweloperzy mają trzy sposoby przesyłania obrazów do modelu:

  • Bezpośrednie osadzanie obrazów za pomocą kodowania Base64.
  • Wskazywanie publicznie dostępnych adresów URL (do 32 MiB).
  • Korzystanie z nowego, bezpłatnego Files API, które umożliwia jednokrotne przesłanie pliku i odwoływanie się do niego za pomocą identyfikatora w wielu żądaniach, z limitem rozmiaru do 64 MiB.

Optymalizacja i limity przetwarzania

Model oferuje opcjonalne pole „detail”, które automatycznie zmniejsza obrazy do rozdzielczości 512 x 512 pikseli, co pozwala zaoszczędzić tokeny, gdy szczegółowość wizualna nie jest kluczowa. Niezależnie od oryginalnej rozdzielczości, model automatycznie normalizuje obrazy do około 800 x 800 pikseli, w zależności od proporcji, przed ich przetworzeniem. Każdy obraz kosztuje maksymalnie 384 tokeny, a ceny są zgodne ze stawkami V4-Flash.

Jedno żądanie może zawierać do 600 obrazów. Maksymalna długość krawędzi obrazu wynosi 8192 piksele na stronę, jednak spada do 4096 pikseli, gdy żądanie zawiera 15 lub więcej obrazów. Obrazy mogą być umieszczane wyłącznie w wiadomościach użytkownika.

Wprowadzenie V4-Flash-Vision-Exp przez Deepseek podkreśla rosnące znaczenie multimodalnych modeli AI, które potrafią przetwarzać i rozumieć zarówno tekst, jak i obrazy. Konkurencja z takimi gigantami jak Opus 4.8 wskazuje na dynamiczny rozwój chińskich firm w dziedzinie sztucznej inteligencji i zwiastuje nowe możliwości dla aplikacji agentowych, które będą w stanie jeszcze lepiej interpretować i reagować na złożone dane wizualne.

Źródło: the-decoder.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Google przedstawia SAM (Sovereign Agent Mesh): bezpieczną sieć P2P dla autonomicznych agentów AI
Hugging Face, Strands i LeRobot łączą siły dla usprawnienia rozwoju agentów AI
Gemini 3.7 Flash: Nowy Model Google dla Programistów i Agentów AI z Niższą Ceną
Deepseek ulepsza model V4 Pro, udostępnia oprogramowanie agentowe jako open source i podnosi ceny API
SpaceXAI prezentuje Grok 4.6: model z kontekstem 500 tys. tokenów dla agentów AI i programistów
Amazon, Microsoft i OpenAI łączą siły, by stworzyć otwarty standard wtyczek dla agentów AI

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.