Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność
Google ogłosiło wprowadzenie agentowego rozumienia wideo dla swoich modeli Gemini Flash, co ma zrewolucjonizować analizę treści wideo, znacząco obniżając koszty i zwiększając precyzję.

Google wprowadza agentowe rozumienie wideo dla swoich modeli Gemini 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite. Nowa funkcja, dostępna już teraz, ma na celu znaczną poprawę dokładności analizy wideo przy jednoczesnym drastycznym obniżeniu zużycia tokenów i kosztów. Użytkownicy mogą aktywować tę możliwość, ustawiając konfigurację API na „agentic” w Google AI Studio lub Gemini Enterprise Agent Platform.
Rewolucja w analizie wideo
Agentowe rozumienie wideo to krok naprzód w porównaniu do dotychczasowego, statycznego przetwarzania, gdzie model analizował wideo ze stałą liczbą klatek na sekundę (domyślnie 1 FPS). Nowa metoda łączy podstawowe zdolności rozumowania modelu z natywnymi narzędziami wideo, umożliwiając dynamiczne wyszukiwanie, skanowanie i inspekcję docelowych segmentów wideo – zarówno wizualnych klatek, ścieżek audio, jak i transkrypcji. Dzięki temu Gemini może aktywnie decydować, które fragmenty wideo są istotne, z jaką prędkością je analizować i za pomocą której modalności, pobierając tylko niezbędne momenty i sygnały.
Ta innowacja przynosi wymierne korzyści:
- Redukcja zużycia tokenów nawet o 88%.
- Obniżenie kosztów analizy nawet o 66%.
- Poprawa dokładności do 7%.
Szczególnie widoczne są te korzyści w przypadku długich materiałów wideo, takich jak 10-minutowe poradniki, 90-minutowe wykłady czy wielogodzinne nagrania. Wcześniej deweloperzy musieli wybierać między wysokimi kosztami tokenów a ryzykiem utraty kluczowych szczegółów. Teraz Gemini może samodzielnie, poprzez pętlę agentową, ładować odpowiednie części pliku wideo, co znacząco zmniejsza nakład pracy programistycznej.
Gemini 3.7 Flash na czele efektywności
Chociaż wszystkie trzy obsługiwane modele Gemini Flash korzystają z agentowego rozumienia wideo, Gemini 3.7 Flash oferuje najlepszą ogólną jakość i optymalne połączenie jakości z efektywnością kosztową. Dzięki temu plasuje się na granicy Pareto dokładności do kosztów wśród testowanych modeli do rozumienia wideo. Oznacza to, że zapewnia najlepszy stosunek jakości do ceny w analizie wideo.
Nowa funkcja umożliwia także:
- Dokładną analizę szybkich akcji poprzez dynamiczne skanowanie i ponowne oglądanie wideo z różnymi liczbami klatek na sekundę.
- Wyszukiwanie „igły w stogu siana” z efektywnym zużyciem tokenów, pozwalając Gemini 3.7 na precyzyjne odpowiadanie na złożone pytania oparte na treści wideo, przy znacznie niższym zużyciu tokenów w porównaniu do analizy statycznej.
Dostępność i przyszłe zastosowania
Agentowe rozumienie wideo jest już dostępne poprzez Gemini API w Google AI Studio i Gemini Enterprise Agent Platform. Korzysta ze standardowych cen tokenów Gemini API, bez dodatkowych opłat za funkcję. Wkrótce funkcja ta zostanie udostępniona miliardom użytkowników w aplikacji Gemini na modelach Flash i Flash-Lite. W nadchodzących miesiącach agentowe rozumienie wideo będzie również wspierać funkcję „Ask YouTube” na stronach oglądania wideo, wykorzystując Gemini do dostarczania wyższej jakości odpowiedzi opartych na treściach wizualnych.
Wprowadzenie agentowego rozumienia wideo przez Google stanowi znaczący krok w rozwoju sztucznej inteligencji zdolnej do interpretacji złożonych danych multimedialnych. Zwiększenie efektywności i dokładności analizy wideo otwiera nowe możliwości dla deweloperów i użytkowników, umożliwiając bardziej zaawansowane i ekonomiczne przetwarzanie treści wideo w wielu wymagających zastosowaniach, od monitoringu po edukację i rozrywkę.
Źródło: deepmind.google
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Google udostępnia Gemini Omni 1.1 Flash: Większa kontrola nad generowaniem wideo AI
Google wprowadza Gemini Omni 1.1 Flash, aktualizację modelu AI do generowania wideo, która oferuje deweloperom rozszerzone możliwości kontroli, w tym płynne przedłużanie scen, precyzyjne przejścia klatka po klatce oraz t
Redakcja Aigest6 dni temu

CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
Max Spero, CEO firmy Pangram, ostrzega przed rosnącym problemem zaufania w internecie, wynikającym z powszechnego użycia treści generowanych przez sztuczną inteligencję. Jego firma oferuje narzędzia do wykrywania AI, aby
Redakcja Aigest9 godz. temu

BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Artykuł analizuje skuteczność tradycyjnych benchmarków w ocenie dużych modeli językowych (LLM), wprowadzając koncepcję BenchMIRT, która ma lepiej oddawać ich rzeczywiste możliwości.
Redakcja Aigestwczoraj
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
OpenAI zapowiada model Astra, który jako pierwszy LLM osiągnął „krytyczny próg cyberbezpieczeństwa”, potrafiąc samodzielnie znajdować i wykorzystywać luki w systemach komputerowych. Firma planuje jego rychłe udostępnieni
Redakcja Aigestwczoraj

Szef Google DeepMind: Liderowanie w rozwoju AI to nasz priorytet
Koray Kavukcuoglu, nowy szef Google DeepMind, podkreśla, że bycie na czele innowacji w sztucznej inteligencji jest kluczowe dla firmy, mimo spekulacji o skupieniu na efektywności kosztowej.
Redakcja Aigestwczoraj

AQuA: Nowatorski system AI do autonomicznego odkrywania czynników i rozwoju modeli w finansach ilościowych
Naukowcy z Princeton, Ant Group i Stanforda przedstawili AQuA – dwuczęściowy system oparty na modelach językowych, który autonomicznie ulepsza procesy badawcze w finansach ilościowych, minimalizując ryzyko błędów.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.