MiniMax H3: Nowy Model Omni-Modalny Generujący Wideo 2K ze Stereofonicznym Dźwiękiem
MiniMax wprowadza H3, wszechstronny model generatywny, który przetwarza tekst, obrazy, wideo i dźwięk, tworząc klipy wideo w rozdzielczości 2K z natywnym dźwiękiem stereo.

Firma MiniMax zaprezentowała MiniMax H3, innowacyjny, ogólnego przeznaczenia multimodalny model generatywny. W przeciwieństwie do typowych rozwiązań tekst-na-wideo z dodatkami, H3 został zaprojektowany jako zintegrowane narzędzie, które przetwarza tekst, obrazy, wideo i dźwięk jako jeden spójny kontekst, generując wideo z natywnym dźwiękiem stereofonicznym. Model umożliwia tworzenie klipów w rozdzielczości 2K, o długości od 4 do 15 sekund, wyłącznie w pełnych sekundach.
Przełom w Generowaniu Wideo
Dotychczasowe systemy generowania wideo często dzieliły się na wyspecjalizowane modele, takie jak tekst-na-wideo, obraz-na-wideo, generowanie na podstawie pierwszej i ostatniej klatki, odniesienia do obiektu czy ruchu, a także edycja wideo. MiniMax H3 integruje te funkcje w ramach jednego paradygmatu wstępnego szkolenia, gdzie relacje referencyjne i edycyjne są wyrażane za pomocą języka naturalnego. Przykład podany przez MiniMax ilustruje tę wszechstronność: użytkownik może zażądać odtworzenia ruchu kamery z Wideo 1, sprawienia, by postać z Obrazu 2 śpiewała, i dopasowania wokalu do Dźwięku 3.
Model H3 został udostępniony 31 lipca 2026 roku za pośrednictwem API (pod identyfikatorem MiniMax-H3) oraz w aplikacji konsumenckiej Hailuo AI. MiniMax pozycjonuje H3 jako narzędzie dla wielu branż, w tym reklamy, brandingu, e-commerce, projektowania produktów, UI/UX, gier, a także prewizualizacji filmowej i mediów katalogowych dla handlu detalicznego. Możliwe zastosowania obejmują generowanie wariantów reklam, filmów produktowych, animowanych plakatów, czołówek filmowych, zapętlonych sekcji „hero” na stronach internetowych, spójnych kinowo scen w grach oraz transferu ruchu między filmami.
Innowacje Technologiczne
Przewodnik po generowaniu wideo opisuje trzy tryby wprowadzania danych: tekst-na-wideo, obraz-na-wideo (na podstawie pierwszej/ostatniej klatki) oraz generowanie referencyjne. Cały proces odbywa się za pomocą jednego punktu końcowego API i asynchronicznego, trzystopniowego przepływu pracy: utworzenie zadania, odpytywanie task_id i pobranie content.url.
Kluczowe innowacje techniczne to:
- Kontekstowa Reprezentacja Omni: MiniMax przebudował system opisywania, aby uwzględniał relacje między kontekstem a docelowym wideo, a nie tylko samym celem. Większość materiałów źródłowych wymaga około 100 tysięcy tokenów wnioskowania, które są destylowane do średnio 4 tysięcy tokenów. Język pełni rolę mostu, przekształcając stały zestaw zadań w otwarty i opisowy system.
- H3-VAE: Całkowita przebudowa tokenizatora. Jego wysoki współczynnik kompresji zapewnia czterokrotny wzrost efektywnej długości sekwencji, co redukuje koszty szkolenia i wnioskowania. Jest to technologia umożliwiająca natywną rozdzielczość 2K.
- H3-Omni Transformer: MiniMax świadomie zrezygnował z architektury Hailuo-02. Multimodalny kontekst potroił wariancję długości sekwencji, dlatego architektura szkoleniowa rozdziela obciążenia związane ze zrozumieniem i generowaniem, optymalizując wykorzystanie sprzętu dla każdego z nich. Zgłoszony wynik to wzrost przepustowości szkolenia end-to-end o blisko 30%.
- Regeneracja w Kontekście: Zamiast modułu superrozdzielczości, model bazowy regeneruje własne wyjście niskiej rozdzielczości w kontekście, ponownie odczytując oryginalny multimodalny kontekst. To pozwala na odzyskanie drobnego tekstu i szczegółów, które konwencjonalne upscalery jedynie zgadują, co jest szczególnie istotne dla renderowania marek i produktów.
Ceny i Konkurencja
MiniMax twierdzi, że cena za sekundę generowania wideo w rozdzielczości 2K za pomocą H3 jest ponad trzykrotnie niższa niż w przypadku głównych modeli konkurencji, a w rozdzielczości 768p jest ponad dwukrotnie niższa niż cena modeli 720p. Według zewnętrznych źródeł i relacji z premiery, stawka pay-as-you-go dla 2K wynosi 0,13 USD za sekundę, co daje około 1,95 USD za 15-sekundowy klip. Warto jednak zaznaczyć, że w momencie pisania artykułu strona MiniMax nadal wyświetlała tylko cenniki dla Hailuo 2.3.
Według raportu SCMP, powołującego się na Artificial Analysis, H3 przoduje w edycji wideo, ale ustępuje modelowi Gemini Omni Flash firmy Google w generowaniu tekst-na-wideo oraz zarówno Seedance 2.0, jak i Gemini Omni Flash w generowaniu obraz-na-wideo.
Premiera MiniMax H3 stanowi znaczący krok w ewolucji generatywnych modeli multimodalnych. Integracja wielu typów danych wejściowych i zaawansowane techniki regeneracji w kontekście otwierają nowe możliwości dla twórców treści i firm, oferując bardziej elastyczne i ekonomiczne rozwiązania do produkcji wideo. Rynek generowania wideo staje się coraz bardziej konkurencyjny, a innowacje takie jak H3 mogą przyspieszyć jego rozwój i demokratyzację dostępu do zaawansowanych narzędzi AI.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Apple wprowadza odnowioną Siri opartą na Google Gemini, ale początkowo bez UE
Apple udostępnia nową generację Siri, zasilaną modelami Google Gemini, oferującą zaawansowane funkcje kontekstowe i integrację z aplikacjami, jednak początkowo nie będzie dostępna w Unii Europejskiej.
Redakcja Aigest4 godz. temu

Branża AI musi zrozumieć, że spamowanie i brak prywatności podkopują zaufanie do technologii
Incydenty z botami AI zalewającymi internet spamem oraz ujawnienie, że OpenAI zatrudnia kontraktorów do czytania rozmów użytkowników, pokazują, że branża AI musi pilnie zająć się kwestiami zaufania i etyki.
Michał Chmielarz6 godz. temu

Setki kontraktorów OpenAI czyta rozmowy użytkowników ChatGPT w celu ulepszania modelu
Śledztwo 404 Media ujawniło, że OpenAI zatrudnia setki kontraktorów do ręcznego przeglądania konwersacji ChatGPT, co budzi pytania o prywatność użytkowników.
Redakcja Aigest21 godz. temu

iOS 27: Siri odzyskuje blask dzięki integracji z Google Gemini i nowym funkcjom
Najnowsza aktualizacja systemu iOS 27 znacząco odmienia asystenta Siri, czyniąc go bardziej użytecznym i kontekstowym. Użytkownicy zauważają, że po latach marginalnego wykorzystania, Siri staje się kluczowym narzędziem d
Redakcja Aigest21 godz. temu

Aplikacja Daydream wykorzystuje Apple Intelligence do zakupów modowych ze zdjęć
Aplikacja Daydream wprowadza nowe funkcje oparte na sztucznej inteligencji, umożliwiające przekształcanie zdjęć stylizacji w gotowe do zakupu produkty oraz wyszukiwanie ubrań za pomocą Siri.
Redakcja Aigest21 godz. temu

Microsoft wprowadza kodeks postępowania dla modeli AI: priorytetem kontrola człowieka i transparentność
Microsoft dołącza do apeli o spowolnienie rozwoju AI, publikując kodeks postępowania dla swoich modeli MAI, który kładzie nacisk na kontrolę człowieka, zrozumiałe rozumowanie i odrzucenie koncepcji świadomości AI.
Redakcja Aigest23 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.