Aigest.
Newsy

Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność

Google ogłosiło wprowadzenie agentowego rozumienia wideo dla swoich modeli Gemini Flash, co ma zrewolucjonizować analizę treści wideo, znacząco obniżając koszty i zwiększając precyzję.

RA

Udostępnij
Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność
Fot. Google DeepMind

Google wprowadza agentowe rozumienie wideo dla swoich modeli Gemini 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite. Nowa funkcja, dostępna już teraz, ma na celu znaczną poprawę dokładności analizy wideo przy jednoczesnym drastycznym obniżeniu zużycia tokenów i kosztów. Użytkownicy mogą aktywować tę możliwość, ustawiając konfigurację API na „agentic” w Google AI Studio lub Gemini Enterprise Agent Platform.

Rewolucja w analizie wideo

Agentowe rozumienie wideo to krok naprzód w porównaniu do dotychczasowego, statycznego przetwarzania, gdzie model analizował wideo ze stałą liczbą klatek na sekundę (domyślnie 1 FPS). Nowa metoda łączy podstawowe zdolności rozumowania modelu z natywnymi narzędziami wideo, umożliwiając dynamiczne wyszukiwanie, skanowanie i inspekcję docelowych segmentów wideo – zarówno wizualnych klatek, ścieżek audio, jak i transkrypcji. Dzięki temu Gemini może aktywnie decydować, które fragmenty wideo są istotne, z jaką prędkością je analizować i za pomocą której modalności, pobierając tylko niezbędne momenty i sygnały.

Ta innowacja przynosi wymierne korzyści:

  • Redukcja zużycia tokenów nawet o 88%.
  • Obniżenie kosztów analizy nawet o 66%.
  • Poprawa dokładności do 7%.

Szczególnie widoczne są te korzyści w przypadku długich materiałów wideo, takich jak 10-minutowe poradniki, 90-minutowe wykłady czy wielogodzinne nagrania. Wcześniej deweloperzy musieli wybierać między wysokimi kosztami tokenów a ryzykiem utraty kluczowych szczegółów. Teraz Gemini może samodzielnie, poprzez pętlę agentową, ładować odpowiednie części pliku wideo, co znacząco zmniejsza nakład pracy programistycznej.

Gemini 3.7 Flash na czele efektywności

Chociaż wszystkie trzy obsługiwane modele Gemini Flash korzystają z agentowego rozumienia wideo, Gemini 3.7 Flash oferuje najlepszą ogólną jakość i optymalne połączenie jakości z efektywnością kosztową. Dzięki temu plasuje się na granicy Pareto dokładności do kosztów wśród testowanych modeli do rozumienia wideo. Oznacza to, że zapewnia najlepszy stosunek jakości do ceny w analizie wideo.

Nowa funkcja umożliwia także:

  • Dokładną analizę szybkich akcji poprzez dynamiczne skanowanie i ponowne oglądanie wideo z różnymi liczbami klatek na sekundę.
  • Wyszukiwanie „igły w stogu siana” z efektywnym zużyciem tokenów, pozwalając Gemini 3.7 na precyzyjne odpowiadanie na złożone pytania oparte na treści wideo, przy znacznie niższym zużyciu tokenów w porównaniu do analizy statycznej.

Dostępność i przyszłe zastosowania

Agentowe rozumienie wideo jest już dostępne poprzez Gemini API w Google AI Studio i Gemini Enterprise Agent Platform. Korzysta ze standardowych cen tokenów Gemini API, bez dodatkowych opłat za funkcję. Wkrótce funkcja ta zostanie udostępniona miliardom użytkowników w aplikacji Gemini na modelach Flash i Flash-Lite. W nadchodzących miesiącach agentowe rozumienie wideo będzie również wspierać funkcję „Ask YouTube” na stronach oglądania wideo, wykorzystując Gemini do dostarczania wyższej jakości odpowiedzi opartych na treściach wizualnych.

Wprowadzenie agentowego rozumienia wideo przez Google stanowi znaczący krok w rozwoju sztucznej inteligencji zdolnej do interpretacji złożonych danych multimedialnych. Zwiększenie efektywności i dokładności analizy wideo otwiera nowe możliwości dla deweloperów i użytkowników, umożliwiając bardziej zaawansowane i ekonomiczne przetwarzanie treści wideo w wielu wymagających zastosowaniach, od monitoringu po edukację i rozrywkę.

Źródło: deepmind.google

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Google udostępnia Gemini Omni 1.1 Flash: Większa kontrola nad generowaniem wideo AI
CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
Szef Google DeepMind: Liderowanie w rozwoju AI to nasz priorytet
AQuA: Nowatorski system AI do autonomicznego odkrywania czynników i rozwoju modeli w finansach ilościowych

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.