Deepseek prezentuje eksperymentalny model wizyjny Flash, konkurujący z Opus 4.8 w testach agentowych
Chińska firma Deepseek wprowadziła na rynek V4-Flash-Vision-Exp, eksperymentalny model multimodalny, który rozszerza możliwości tekstowe o rozumienie obrazów. Według wewnętrznych testów Deepseek, model ten niemal dorównu

Chińska firma Deepseek ogłosiła wydanie V4-Flash-Vision-Exp, eksperymentalnego modelu multimodalnego, który wzbogaca dotychczasowe możliwości tekstowe o rozumienie obrazów. Według wewnętrznych testów Deepseek, nowy model niemal dorównuje Opus 4.8 w zadaniach agentowych, co stanowi znaczący krok w rozwoju technologii sztucznej inteligencji.
Rozszerzone możliwości i zastosowania
Model Deepseek-V4-Flash-Vision-Exp rozszerza funkcjonalność Deepseek-V4-Flash o przetwarzanie obrazów, jednocześnie zachowując wysoką wydajność bazowego modelu w zakresie rozumowania i wiedzy ogólnej. Deepseek pozycjonuje ten model jako narzędzie do zastosowań opartych na agentach, projektując go do współpracy z różnymi frameworkami agentowymi. Jego kluczową cechą jest zdolność do łączenia rozumienia wizualnego z wykorzystaniem narzędzi. W praktyce model może opisywać obrazy, wyodrębniać tekst ze zrzutów ekranu oraz analizować diagramy. Obsługuje popularne formaty plików graficznych, takie jak JPEG, PNG, GIF i WebP, a co istotne, określa format na podstawie rzeczywistej zawartości pliku, a nie nazwy czy deklarowanego typu MIME, zgodnie z dokumentacją API.
Integracja i elastyczność dla deweloperów
Model jest kompatybilny z API OpenAI Chat Completions i Responses oraz z punktem końcowym Anthropic Messages, co ułatwia jego integrację z istniejącymi platformami. Deepseek udostępnił również wersję 0.1.1 swojego frameworka Harness, który od razu wspiera nowy model. Deweloperzy mają trzy sposoby przesyłania obrazów do modelu:
- Bezpośrednie osadzanie obrazów za pomocą kodowania Base64.
- Wskazywanie publicznie dostępnych adresów URL (do 32 MiB).
- Korzystanie z nowego, bezpłatnego Files API, które umożliwia jednokrotne przesłanie pliku i odwoływanie się do niego za pomocą identyfikatora w wielu żądaniach, z limitem rozmiaru do 64 MiB.
Optymalizacja i limity przetwarzania
Model oferuje opcjonalne pole „detail”, które automatycznie zmniejsza obrazy do rozdzielczości 512 x 512 pikseli, co pozwala zaoszczędzić tokeny, gdy szczegółowość wizualna nie jest kluczowa. Niezależnie od oryginalnej rozdzielczości, model automatycznie normalizuje obrazy do około 800 x 800 pikseli, w zależności od proporcji, przed ich przetworzeniem. Każdy obraz kosztuje maksymalnie 384 tokeny, a ceny są zgodne ze stawkami V4-Flash.
Jedno żądanie może zawierać do 600 obrazów. Maksymalna długość krawędzi obrazu wynosi 8192 piksele na stronę, jednak spada do 4096 pikseli, gdy żądanie zawiera 15 lub więcej obrazów. Obrazy mogą być umieszczane wyłącznie w wiadomościach użytkownika.
Wprowadzenie V4-Flash-Vision-Exp przez Deepseek podkreśla rosnące znaczenie multimodalnych modeli AI, które potrafią przetwarzać i rozumieć zarówno tekst, jak i obrazy. Konkurencja z takimi gigantami jak Opus 4.8 wskazuje na dynamiczny rozwój chińskich firm w dziedzinie sztucznej inteligencji i zwiastuje nowe możliwości dla aplikacji agentowych, które będą w stanie jeszcze lepiej interpretować i reagować na złożone dane wizualne.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Google przedstawia SAM (Sovereign Agent Mesh): bezpieczną sieć P2P dla autonomicznych agentów AI
Google wprowadza Sovereign Agent Mesh (SAM), projekt sieciowy typu open-source, który ma na celu bezpieczne łączenie autonomicznych agentów AI działających na różnych platformach, eliminując potrzebę wystawiania wewnętrz
Redakcja Aigest3 dni temu

Hugging Face, Strands i LeRobot łączą siły dla usprawnienia rozwoju agentów AI
Hugging Face ogłosiło współpracę ze Strands i LeRobot, aby stworzyć zintegrowane środowisko do nagrywania, trenowania i wdrażania agentów AI. Inicjatywa ma na celu uproszczenie procesu rozwoju sztucznej inteligencji.
Redakcja Aigest13 sie 2026

Gemini 3.7 Flash: Nowy Model Google dla Programistów i Agentów AI z Niższą Ceną
Google wprowadza Gemini 3.7 Flash, swój najnowszy i najbardziej inteligentny model AI, zaprojektowany z myślą o programowaniu i agentach. Nowa wersja oferuje znaczące ulepszenia wydajności przy jednoczesnym obniżeniu kos
Redakcja Aigest13 sie 2026

Deepseek ulepsza model V4 Pro, udostępnia oprogramowanie agentowe jako open source i podnosi ceny API
Deepseek ogłosił znaczące zmiany, wprowadzając ulepszoną wersję swojego flagowego modelu V4 Pro, udostępniając autorskie oprogramowanie agentowe jako open source oraz podnosząc ceny dostępu do API.
Redakcja Aigest13 sie 2026

SpaceXAI prezentuje Grok 4.6: model z kontekstem 500 tys. tokenów dla agentów AI i programistów
SpaceXAI udostępniło Grok 4.6, ulepszoną wersję swojego modelu AI, która oferuje znacznie większy kontekst i lepszą wydajność w zadaniach wymagających długotrwałego działania agentów oraz w pracy z kodem.
Redakcja Aigest13 sie 2026

Amazon, Microsoft i OpenAI łączą siły, by stworzyć otwarty standard wtyczek dla agentów AI
Wiodące firmy technologiczne, w tym Amazon, Microsoft i OpenAI, ogłosiły współpracę nad Agent Plugins – otwartym standardem dla rozszerzeń agentów AI, mającym ujednolicić rozwój i ponowne wykorzystanie wtyczek.
Redakcja Aigest7 sie 2026
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.