Aigest.
Newsy

Google Gemini Flash z nową funkcją agentowego rozumienia wideo: oszczędność tokenów do 88%

Google wprowadza znaczącą innowację w modelach Gemini Flash, umożliwiając im agentowe rozumienie treści wideo. Nowa technologia pozwala na analizę tylko niezbędnych segmentów, co drastycznie redukuje zużycie tokenów.

RA

Udostępnij
Google Gemini Flash z nową funkcją agentowego rozumienia wideo: oszczędność tokenów do 88%
Ilustracja poglądowa

Google ogłosiło wprowadzenie nowej funkcji agentowego rozumienia wideo dla swoich modeli Gemini Flash. Ta innowacja ma na celu znaczące usprawnienie sposobu, w jaki modele AI przetwarzają materiały wideo, koncentrując się na efektywności i redukcji zasobów. Dzięki temu rozwiązaniu, Gemini Flash nie będzie już przetwarzać całego wideo klatka po klatce, lecz inteligentnie analizować tylko te fragmenty, które są istotne dla danego zapytania, co przekłada się na drastyczne obniżenie zużycia tokenów.

Rewolucja w przetwarzaniu wideo przez AI

Dotychczasowe podejście do analizy wideo przez modele AI, takie jak Gemini, polegało na ingestowaniu materiału z prędkością jednej klatki na sekundę (1 FPS). Oznaczało to, że model musiał przetworzyć każdą pojedynczą klatkę, niezależnie od tego, czy jej zawartość była kluczowa dla zrozumienia kontekstu czy odpowiedzi na zadane pytanie. Było to podejście zasobochłonne i często nieefektywne, zwłaszcza w przypadku długich nagrań.

Nowe agentowe rozumienie wideo zmienia tę paradygmat. Zamiast sekwencyjnego przetwarzania, modele Gemini Flash będą teraz „nawigować” po wideo. Oznacza to, że AI aktywnie identyfikuje i ładuje wyłącznie te segmenty wideo, które są bezpośrednio związane z treścią zapytania użytkownika. Ta selektywna analiza pozwala na znacznie szybsze i bardziej precyzyjne dotarcie do kluczowych informacji zawartych w materiale filmowym.

Znacząca redukcja zużycia tokenów

Kluczową korzyścią wynikającą z wprowadzenia agentowego rozumienia wideo jest redukcja zużycia tokenów. Google informuje, że nowa metoda pozwala na zmniejszenie liczby tokenów nawet o 88%. Tokeny są podstawową jednostką przetwarzania w modelach językowych i wizualnych, a ich zużycie bezpośrednio przekłada się na koszty operacyjne oraz szybkość działania systemu. Ograniczenie ich liczby oznacza więc nie tylko większą efektywność, ale także potencjalnie niższe koszty dla deweloperów i użytkowników korzystających z API Gemini Flash.

Ta zmiana otwiera nowe możliwości dla aplikacji wykorzystujących analizę wideo, od zaawansowanych systemów monitoringu, przez narzędzia do edycji i wyszukiwania treści, po interaktywne asystenty potrafiące odpowiadać na pytania dotyczące skomplikowanych materiałów filmowych. Zdolność modeli AI do inteligentnego wyboru i przetwarzania tylko istotnych fragmentów wideo stanowi krok milowy w rozwoju multimodalnych systemów sztucznej inteligencji, czyniąc je bardziej praktycznymi i ekonomicznymi w zastosowaniach rzeczywistych.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność
Google udostępnia Gemini Omni 1.1 Flash: Większa kontrola nad generowaniem wideo AI
Google wprowadza Gemini 3.8 Flash, trzeci model Flash w sześć tygodni
Google uruchamia program Fairwind: zaawansowana cyberobrona dla rządów i przedsiębiorstw
Badanie AlgorithmWatch: AI Overviews Google'a w kontekście wyborów są nieprzejrzyste i stronnicze
OpenAI prezentuje GPT-6 Astra: model do zastosowań komputerowych z kontekstem 1.05M i progiem cyberbezpieczeństwa

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.