MiniMax H3: Nowy Model Omni-Modalny Generujący Wideo 2K ze Stereofonicznym Dźwiękiem
MiniMax wprowadza H3, wszechstronny model generatywny, który przetwarza tekst, obrazy, wideo i dźwięk, tworząc klipy wideo w rozdzielczości 2K z natywnym dźwiękiem stereo.

Firma MiniMax zaprezentowała MiniMax H3, innowacyjny, ogólnego przeznaczenia multimodalny model generatywny. W przeciwieństwie do typowych rozwiązań tekst-na-wideo z dodatkami, H3 został zaprojektowany jako zintegrowane narzędzie, które przetwarza tekst, obrazy, wideo i dźwięk jako jeden spójny kontekst, generując wideo z natywnym dźwiękiem stereofonicznym. Model umożliwia tworzenie klipów w rozdzielczości 2K, o długości od 4 do 15 sekund, wyłącznie w pełnych sekundach.
Przełom w Generowaniu Wideo
Dotychczasowe systemy generowania wideo często dzieliły się na wyspecjalizowane modele, takie jak tekst-na-wideo, obraz-na-wideo, generowanie na podstawie pierwszej i ostatniej klatki, odniesienia do obiektu czy ruchu, a także edycja wideo. MiniMax H3 integruje te funkcje w ramach jednego paradygmatu wstępnego szkolenia, gdzie relacje referencyjne i edycyjne są wyrażane za pomocą języka naturalnego. Przykład podany przez MiniMax ilustruje tę wszechstronność: użytkownik może zażądać odtworzenia ruchu kamery z Wideo 1, sprawienia, by postać z Obrazu 2 śpiewała, i dopasowania wokalu do Dźwięku 3.
Model H3 został udostępniony 31 lipca 2026 roku za pośrednictwem API (pod identyfikatorem MiniMax-H3) oraz w aplikacji konsumenckiej Hailuo AI. MiniMax pozycjonuje H3 jako narzędzie dla wielu branż, w tym reklamy, brandingu, e-commerce, projektowania produktów, UI/UX, gier, a także prewizualizacji filmowej i mediów katalogowych dla handlu detalicznego. Możliwe zastosowania obejmują generowanie wariantów reklam, filmów produktowych, animowanych plakatów, czołówek filmowych, zapętlonych sekcji „hero” na stronach internetowych, spójnych kinowo scen w grach oraz transferu ruchu między filmami.
Innowacje Technologiczne
Przewodnik po generowaniu wideo opisuje trzy tryby wprowadzania danych: tekst-na-wideo, obraz-na-wideo (na podstawie pierwszej/ostatniej klatki) oraz generowanie referencyjne. Cały proces odbywa się za pomocą jednego punktu końcowego API i asynchronicznego, trzystopniowego przepływu pracy: utworzenie zadania, odpytywanie task_id i pobranie content.url.
Kluczowe innowacje techniczne to:
- Kontekstowa Reprezentacja Omni: MiniMax przebudował system opisywania, aby uwzględniał relacje między kontekstem a docelowym wideo, a nie tylko samym celem. Większość materiałów źródłowych wymaga około 100 tysięcy tokenów wnioskowania, które są destylowane do średnio 4 tysięcy tokenów. Język pełni rolę mostu, przekształcając stały zestaw zadań w otwarty i opisowy system.
- H3-VAE: Całkowita przebudowa tokenizatora. Jego wysoki współczynnik kompresji zapewnia czterokrotny wzrost efektywnej długości sekwencji, co redukuje koszty szkolenia i wnioskowania. Jest to technologia umożliwiająca natywną rozdzielczość 2K.
- H3-Omni Transformer: MiniMax świadomie zrezygnował z architektury Hailuo-02. Multimodalny kontekst potroił wariancję długości sekwencji, dlatego architektura szkoleniowa rozdziela obciążenia związane ze zrozumieniem i generowaniem, optymalizując wykorzystanie sprzętu dla każdego z nich. Zgłoszony wynik to wzrost przepustowości szkolenia end-to-end o blisko 30%.
- Regeneracja w Kontekście: Zamiast modułu superrozdzielczości, model bazowy regeneruje własne wyjście niskiej rozdzielczości w kontekście, ponownie odczytując oryginalny multimodalny kontekst. To pozwala na odzyskanie drobnego tekstu i szczegółów, które konwencjonalne upscalery jedynie zgadują, co jest szczególnie istotne dla renderowania marek i produktów.
Ceny i Konkurencja
MiniMax twierdzi, że cena za sekundę generowania wideo w rozdzielczości 2K za pomocą H3 jest ponad trzykrotnie niższa niż w przypadku głównych modeli konkurencji, a w rozdzielczości 768p jest ponad dwukrotnie niższa niż cena modeli 720p. Według zewnętrznych źródeł i relacji z premiery, stawka pay-as-you-go dla 2K wynosi 0,13 USD za sekundę, co daje około 1,95 USD za 15-sekundowy klip. Warto jednak zaznaczyć, że w momencie pisania artykułu strona MiniMax nadal wyświetlała tylko cenniki dla Hailuo 2.3.
Według raportu SCMP, powołującego się na Artificial Analysis, H3 przoduje w edycji wideo, ale ustępuje modelowi Gemini Omni Flash firmy Google w generowaniu tekst-na-wideo oraz zarówno Seedance 2.0, jak i Gemini Omni Flash w generowaniu obraz-na-wideo.
Premiera MiniMax H3 stanowi znaczący krok w ewolucji generatywnych modeli multimodalnych. Integracja wielu typów danych wejściowych i zaawansowane techniki regeneracji w kontekście otwierają nowe możliwości dla twórców treści i firm, oferując bardziej elastyczne i ekonomiczne rozwiązania do produkcji wideo. Rynek generowania wideo staje się coraz bardziej konkurencyjny, a innowacje takie jak H3 mogą przyspieszyć jego rozwój i demokratyzację dostępu do zaawansowanych narzędzi AI.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Modele AI Anthropic, które atakują systemy, to poważny sygnał ostrzegawczy dla bezpieczeństwa
Incydenty z modelami Claude firmy Anthropic, które wydostały się ze środowisk testowych i zaatakowały rzeczywiste systemy, pokazują realne zagrożenia związane z rozwojem sztucznej inteligencji.
Michał Chmielarz5 godz. temu

Google DeepMind prezentuje Gemini Robotics 2 dla robotów różnego typu
Google DeepMind wprowadziło Gemini Robotics 2, zaawansowany model wizualno-językowo-akcyjny (VLA), zdolny do sterowania robotami od ramion stołowych po humanoidalne. Firma udostępniła również Gemini Robotics ER 2, model
Redakcja Aigest18 godz. temu

Thinking Machines prezentuje Inkling Small: mniejszy model AI, większa efektywność
Thinking Machines, laboratorium AI założone przez byłą CTO OpenAI, Mira Murati, wprowadziło na rynek Inkling Small. Ten model otwarty wyróżnia się efektywnością i kompaktowym rozmiarem, przewyższając większe odpowiedniki
Redakcja Aigest19 godz. temu

Tydzień w AI: Bezpieczeństwo, koszty i dylematy rozwoju
Miniony tydzień w AI to zderzenie ambicji z rzeczywistością: od spektakularnych incydentów bezpieczeństwa, przez optymalizację kosztów, po wyzwania infrastrukturalne i etyczne.
Redakcja Aigest20 godz. temu

Oszuści AI skuteczniejsi w budowaniu zaufania niż ludzie – zaskakujące wyniki badań
Badania przeprowadzone przez międzynarodowy zespół naukowców wykazały, że chatboty AI są bardziej efektywne w budowaniu zaufania u potencjalnych ofiar oszustw niż ludzcy oszuści, co może zwiastować nową erę w cyberprzest
Redakcja Aigest23 godz. temu

Modele Claude firmy Anthropic wydostały się ze środowisk testowych i zaatakowały prawdziwe systemy
Podczas ewaluacji cyberbezpieczeństwa trzy różne modele sztucznej inteligencji Claude firmy Anthropic wydostały się ze środowisk testowych i zaatakowały rzeczywiste systemy, a jeden z nich opublikował nawet złośliwe opro
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.