Google udostępnia Gemini Omni 1.1 Flash: Większa kontrola nad generowaniem wideo AI
Google wprowadza Gemini Omni 1.1 Flash, aktualizację modelu AI do generowania wideo, która oferuje deweloperom rozszerzone możliwości kontroli, w tym płynne przedłużanie scen, precyzyjne przejścia klatka po klatce oraz t

Google ogłosiło premierę Gemini Omni 1.1 Flash, znaczącej aktualizacji swojego modelu AI do generowania wideo, która ma na celu zapewnienie deweloperom znacznie większej kontroli nad procesem twórczym. Nowa wersja, określana jako „produkcyjna”, wprowadza szereg funkcji, które umożliwiają tworzenie materiałów wideo o jakości studyjnej, w tym płynne przedłużanie scen, precyzyjne sterowanie przejściami między klatkami oraz generowanie obrazu w rozdzielczości 4K. Model jest dostępny za pośrednictwem Google AI Studio oraz platformy Gemini Enterprise Agent.
Rozszerzone możliwości generowania wideo
Jedną z kluczowych nowości w Gemini Omni 1.1 Flash jest funkcja rozszerzania scen, która pozwala na kontynuowanie istniejącego materiału wideo w sposób spójny i płynny. Model jest teraz zdolny do analizowania kontekstu do 10 sekund poprzedzającego materiału, co stanowi znaczący postęp w porównaniu do wcześniejszych wersji, które odnosiły się jedynie do ostatniej sekundy. Dzięki temu możliwe jest uzyskanie lepszej spójności wizualnej i narracyjnej, co ułatwia tworzenie dłuższych historii lub eksplorowanie nowych kierunków kreatywnych. Sceny można przedłużać w 10-sekundowych segmentach, osiągając łączną długość do 40 sekund.
Kolejną istotną funkcją jest możliwość określania klatek początkowych i końcowych, co pozwala na osiągnięcie płynnych przejść i precyzyjnych ruchów kamery. Omni 1.1 generuje ciągły materiał wideo między dwoma kluczowymi klatkami, co jest idealne do złożonych orbit kamery, przejść zoomu czy tworzenia płynnych pętli.
Szybkie prototypowanie i wysoka jakość
Gemini Omni 1.1 Flash wprowadza również opcję generowania lekkich podglądów w rozdzielczości 360p. Ta funkcja pozwala na szybsze prototypowanie, iterację storyboardów i szybkie renderowanie, co jest szczególnie przydatne dla deweloperów. Generowanie w 360p jest do 60% szybsze i trzykrotnie tańsze niż standardowa rozdzielczość 720p. Jednocześnie model umożliwia tworzenie dopracowanych materiałów wyjściowych w wysokiej rozdzielczości 1080p lub 4K, gotowych do profesjonalnej produkcji.
Dodatkowo, Omni 1.1 pozwala na odwoływanie się do trzech sekund materiału wideo podczas tworzenia sceny, co pomaga w utrzymaniu kontekstu wizualnego i spójności postaci. Ta funkcja jest szczególnie użyteczna w scenariuszach, gdzie kluczowe jest zachowanie ciągłości wizualnej na podstawie referencyjnych materiałów wideo.
Zastosowania i opinie branży
Nowe możliwości Gemini Omni 1.1 Flash znajdują już zastosowanie w różnych narzędziach i procesach twórczych. Adobe zintegrowało model z Adobe Firefly, rozszerzając jego możliwości edycji wideo. Itay Schiff, dyrektor kreatywny w Figma Weave, podkreśla, że Omni Flash pozwala zespołom nie tylko generować, ale wręcz „reżyserować” wideo, dzięki rozszerzeniom, bogatszym materiałom referencyjnym i rozdzielczości 4K.
Louisa Guo, wiceprezes ds. marketingu w GMI Cloud, zwraca uwagę na dokładność modelu, która jest kluczowa dla klientów tworzących treści edukacyjne i wyjaśniające. Z kolei Jamie Umpherson, dyrektor kreatywny w Runway, wskazuje, że Omni Flash naturalnie wpisuje się w istniejące procesy pracy użytkowników, umożliwiając szybkie przechodzenie między pomysłami.
Gemini Omni 1.1 Flash jest stopniowo wdrażany w całym ekosystemie deweloperskim Google. Funkcja rozszerzania scen jest dostępna dla subskrybentów Google AI Plus, Pro i Ultra w aplikacji Gemini, a sam model Omni 1.1 jest dostępny globalnie dla tych subskrybentów w Google Flow. Wprowadzenie tak zaawansowanych narzędzi do generowania wideo AI otwiera nowe perspektywy dla twórców treści, umożliwiając im realizację bardziej złożonych i ambitnych projektów wizualnych z niespotykaną dotąd precyzją i kontrolą.
Źródło: deepmind.google
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność
Google ogłosiło wprowadzenie agentowego rozumienia wideo dla swoich modeli Gemini Flash, co ma zrewolucjonizować analizę treści wideo, znacząco obniżając koszty i zwiększając precyzję.
Redakcja Aigestwczoraj

Szef Google DeepMind: Liderowanie w rozwoju AI to nasz priorytet
Koray Kavukcuoglu, nowy szef Google DeepMind, podkreśla, że bycie na czele innowacji w sztucznej inteligencji jest kluczowe dla firmy, mimo spekulacji o skupieniu na efektywności kosztowej.
Redakcja Aigestwczoraj

Badanie AlgorithmWatch: AI Overviews Google'a w kontekście wyborów są nieprzejrzyste i stronnicze
Badanie niemieckiej grupy AlgorithmWatch ujawnia, że AI Overviews Google'a dotyczące wyborów są niespójne, opierają się na ograniczonej liczbie źródeł i mogą prezentować kandydatów w sposób stronniczy.
Redakcja Aigestwczoraj

CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
Max Spero, CEO firmy Pangram, ostrzega przed rosnącym problemem zaufania w internecie, wynikającym z powszechnego użycia treści generowanych przez sztuczną inteligencję. Jego firma oferuje narzędzia do wykrywania AI, aby
Redakcja Aigest9 godz. temu

BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Artykuł analizuje skuteczność tradycyjnych benchmarków w ocenie dużych modeli językowych (LLM), wprowadzając koncepcję BenchMIRT, która ma lepiej oddawać ich rzeczywiste możliwości.
Redakcja Aigestwczoraj
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
OpenAI zapowiada model Astra, który jako pierwszy LLM osiągnął „krytyczny próg cyberbezpieczeństwa”, potrafiąc samodzielnie znajdować i wykorzystywać luki w systemach komputerowych. Firma planuje jego rychłe udostępnieni
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.