Google AI prezentuje Gemini Omni 1.1 Flash: rozszerzanie scen, kontrola klatek i skalowanie do 4K
Google AI wprowadza Gemini Omni 1.1 Flash, znaczącą aktualizację swojego multimodalnego modelu do generowania i edycji wideo, która oferuje rozszerzanie scen, precyzyjną kontrolę nad klatkami początkowymi i końcowymi ora

Google AI zaprezentowało Gemini Omni 1.1 Flash (gemini-omni-1.1-flash), produkcyjną aktualizację swojego natywnego, multimodalnego modelu do generowania i edycji wideo. Nowa wersja przekształca Omni z narzędzia zdolnego do generowania treści w model, który oferuje znacznie większą kontrolę nad procesem twórczym. Wśród kluczowych nowości znalazły się: możliwość rozszerzania scen z uwzględnieniem do 10 sekund wcześniejszego kontekstu, precyzyjne przypinanie klatek początkowych i końcowych w celu kontroli ruchu kamery, renderowanie wersji roboczych w rozdzielczości 360p przy znacznie niższych kosztach, skalowanie finalnych materiałów do 4K oraz wykorzystywanie klipów wideo jako referencji dla spójności postaci.
Kluczowe innowacje i funkcjonalności
Gemini Omni Flash opiera się na trzech filarach, które Google wyróżnia na tle poprzednich modeli wideo: natywna multimodalność (jednoczesne przetwarzanie tekstu, obrazu, dźwięku i wideo), konwersacyjna edycja za pośrednictwem interfejsu API Interactions oraz wiedza o świecie odziedziczona po modelu Gemini. Edycja jest stanowa, co oznacza, że model zapamiętuje poprzednie interakcje i stosuje zmiany, zachowując niezmienione elementy bez konieczności ponownego przesyłania wcześniejszego wideo. Model jest dostępny poprzez Gemini API w Google AI Studio i Gemini Enterprise Agent Platform, a wśród pierwszych użytkowników produkcyjnych wymieniono już firmy takie jak Adobe, Figma Weave, GMI Cloud i Runway.
Rozszerzanie scen i kontrola nad wideo
Omni 1.1 analizuje do 10 sekund wcześniejszego kontekstu przy kontynuowaniu klipu, podczas gdy poprzednie modele odnosiły się tylko do ostatniej sekundy. Rozszerzenia są realizowane w 10-sekundowych przyrostach, osiągając łącznie 40 sekund. Model generuje kontynuację trwającą od 3 do 10 sekund na każde wywołanie, a niektóre klatki końcowe wejściowego materiału są edytowane, aby zapewnić płynne przejście. Istnieją jednak pewne ograniczenia: rozszerzanie działa tylko na końcu klipu (bez wstawiania na początku lub w środku), a przesyłane filmy wejściowe muszą mieć maksymalnie 10 sekund, chyba że rozszerza się wideo wygenerowane przez model w trybie wieloetapowym. Nie można również dodawać nowego dialogu podczas rozszerzania przesłanego wideo, w którym ktoś mówi, choć dialog mówiony jest obsługiwany w trybie wieloetapowym poprzez previous_interaction_id.
Nowością jest również możliwość dostarczenia pierwszej i ostatniej klatki, a model wygeneruje ciągłe wideo pomiędzy nimi. Mechanizm ten umożliwia tworzenie płynnych ruchów kamery, takich jak orbity, zbliżenia dolly-zoom oraz zapętlone sekwencje. Podpowiedzi wiążą media z rolami za pomocą tagów, takich jak FIRST_FRAME, LAST_FRAME, IMAGE_REF_N i VIDEO_REF_N. Referencje wideo akceptują maksymalnie trzy klipy, każdy do trzech sekund, i najlepiej sprawdzają się w przypadku spójności postaci. Dźwięk w referencji wideo jest ignorowany, a wnioskowanie na podstawie wielu filmów nie jest obsługiwane i może pogorszyć jakość wyjściową.
Jakość, koszty i ograniczenia
Parametr resolution w response_format pozwala na wybór rozdzielczości 360p, 720p (domyślna), 1080p i 4K, przy czym dwie najwyższe są skalowane. Google informuje, że podglądy w 360p generują się do 60% szybciej i kosztują jedną trzecią ceny 720p, co czyni cykl roboczy „szkicuj, a następnie skaluj” zamierzonym wzorcem produkcyjnym: tania iteracja, jednorazowe renderowanie. Koszt wejścia wynosi 1,50 USD za 1 milion tokenów (tekst, obraz, wideo, audio), natomiast koszt wyjścia to 9,00 USD za 1 milion tokenów tekstowych i 17,50 USD za 1 milion tokenów wideo. Rozliczanie wideo odbywa się po stawce 5 792 tokenów na sekundę w rozdzielczości 720p, co przekłada się na około 0,10 USD za sekundę w standardowej cenie.
Każde wygenerowane wideo jest znakowane wodnym znakiem SynthID, niewidocznym dla widzów, ale programowo wykrywalnym w celu weryfikacji pochodzenia. Warto zaznaczyć, że model ma pewne luki: brak instrukcji systemowych, kontroli temperatury, top_p, sekwencji zatrzymania czy negatywnych podpowiedzi (negatywy umieszcza się w tekście podpowiedzi). Edycja głosu, referencje audio oraz wykorzystywanie adresów URL YouTube jako źródła są nieobsługiwane. Język angielski jest w pełni wspierany, natomiast inne języki nie zostały jeszcze ocenione. W przypadku wyników powyżej 4 MB, należy użyć delivery="uri" i odpytywać API Files, aż plik będzie aktywny.
Nowe funkcje Gemini Omni 1.1 Flash znacząco zwiększają możliwości twórców w zakresie edycji i generowania wideo, oferując większą kontrolę i efektywność kosztową. Dostępność modelu dla dużych graczy rynkowych, takich jak Adobe, wskazuje na jego potencjał do integracji z profesjonalnymi narzędziami, co może przyspieszyć rozwój innowacyjnych zastosowań AI w produkcji multimediów. Wprowadzenie zaawansowanych mechanizmów kontroli i optymalizacji kosztów renderowania może zrewolucjonizować procesy twórcze, czyniąc je bardziej dostępnymi i elastycznymi dla szerokiego grona użytkowników.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Amazon wykorzystuje AI do walki z oszustwami, Alexa pomoże rozpoznać scamy
Amazon wprowadza nowe funkcje oparte na sztucznej inteligencji, aby pomóc klientom w identyfikacji fałszywych wiadomości i oszustw. Usługa Alexa for Shopping będzie teraz w stanie potwierdzić autentyczność komunikacji od
Redakcja Aigest11 godz. temu

Google DeepMind stawia na innowacje, ignorując ryzyko rynkowe i etyczne
Deklaracja szefa Google DeepMind o priorytecie innowacji w AI, w obliczu ostrzeżeń Banku Anglii i problemów z AI Overviews, budzi poważne pytania o odpowiedzialność liderów rynku.
Michał Chmielarz18 godz. temu
Meta Superintelligence Labs wprowadza Muse Voice Transcribe – jeden model dla transkrypcji, diaryzacji i detekcji końca
Meta Superintelligence Labs zaprezentowało Muse Voice Transcribe, innowacyjny model AI, który łączy funkcje transkrypcji mowy, rozdzielania mówców i detekcji końca wypowiedzi w jednym systemie, znacząco redukując opóźnie
Redakcja Aigest20 godz. temu

BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Artykuł analizuje skuteczność tradycyjnych benchmarków w ocenie dużych modeli językowych (LLM), wprowadzając koncepcję BenchMIRT, która ma lepiej oddawać ich rzeczywiste możliwości.
Redakcja Aigestwczoraj
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
OpenAI zapowiada model Astra, który jako pierwszy LLM osiągnął „krytyczny próg cyberbezpieczeństwa”, potrafiąc samodzielnie znajdować i wykorzystywać luki w systemach komputerowych. Firma planuje jego rychłe udostępnieni
Redakcja Aigestwczoraj

Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność
Google ogłosiło wprowadzenie agentowego rozumienia wideo dla swoich modeli Gemini Flash, co ma zrewolucjonizować analizę treści wideo, znacząco obniżając koszty i zwiększając precyzję.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.