Black Forest Labs prezentuje FLUX 3: Multimodalny model AI do przewidywania obrazu, wideo, dźwięku i akcji robotów
Black Forest Labs (BFL) wprowadziło na rynek FLUX 3, multimodalny model fundamentowy, który integruje przetwarzanie obrazu, wideo i dźwięku w jednej architekturze, oferując jednocześnie przewidywanie akcji.

Black Forest Labs (BFL) ogłosiło premierę FLUX 3, przełomowego multimodalnego modelu fundamentowego, który uczy się z obrazów, wideo i dźwięku w ramach jednej, spójnej architektury. Jest to pierwszy model FLUX, który dostarcza funkcje przewidywania wideo, audio i akcji z jednego zestawu wag, co stanowi znaczący krok w rozwoju sztucznej inteligencji.
Integracja modalności dla pełniejszego zrozumienia świata
Zespół badawczy Black Forest Labs podkreśla, że żadna pojedyncza modalność nie jest w stanie zapewnić kompletnego opisu świata. Obrazy rejestrują strukturę przestrzenną w danej chwili, wideo dodaje wymiar czasu i ujawnia dynamikę fizyczną, natomiast dźwięk odkrywa związki przyczynowo-skutkowe między zdarzeniami mechanicznymi a ich brzmieniem. Każda z tych modalności jest traktowana jako częściowa projekcja tej samej, bazowej rzeczywistości. Trenowanie modelu na wszystkich tych danych jednocześnie sprawia, że modalności wzajemnie się uzupełniają i ograniczają. Dźwięk musi odpowiadać uderzeniu, a ruch musi być zgodny z masą. FLUX 3 jest pierwszym modelem BFL zbudowanym w całości na tej zasadzie.
Architektura i skalowanie FLUX 3
FLUX 3 bazuje na metodzie Self-Flow, opracowanej przez BFL, która ma na celu ujednolicenie generowania i rozumienia multimodalnego w jednej architekturze. Self-Flow łączy cel dopasowania przepływu (flow matching objective) z celem samonadzorowanej rekonstrukcji cech. Implementacja referencyjna na GitHubie jest dostępna na licencji Apache-2.0 i wykorzystuje SiT-XL/2 z warunkowaniem kroku czasowego dla każdego tokena. Model jest trenowany z 25% współczynnikiem maskowania tokenów i samodystylacją z nauczyciela EMA na warstwie 20 do ucznia na warstwie 8. Warto zaznaczyć, że Self-Flow zostało wprowadzone już w marcu 2026 roku, więc nie jest nowością. Nowością w przypadku FLUX 3 jest skala, w jakiej BFL zastosowało to podejście, znacznie zwiększając zasoby obliczeniowe i dane do jednoczesnego trenowania modelu na wideo, obrazach i dźwięku.
Możliwości generatywne i wyniki preferencji użytkowników
FLUX 3 oferuje zaawansowane możliwości generowania wideo, tworząc klipy o długości do 20 sekund z natywnym dźwiękiem w ramach jednej generacji. Obsługiwane tryby obejmują:
- Tekst na wideo
- Obraz na wideo
- Wideo na wideo (z klipu referencyjnego)
- Klatka kluczowa na wideo (dla kontrolowanych przejść)
- Generatywna kontynuacja wideo-audio (na podstawie wejściowego wideo i audio)
Ponadto BFL wymienia takie funkcje jak wielojęzyczny dialog, łączenie klipów w sekwencje wieloklatkowe oraz generowanie silnej typografii z animowanymi projektami. Zespół BFL podkreśla szczególną siłę modelu w odwzorowywaniu ludzkich mimik oraz w kojarzeniu dźwięków z wydarzeniami fizycznymi.
Black Forest Labs opublikowało również wstępne wyniki preferencji użytkowników. W testach, gdzie porównywano 10-sekundowe klipy tekst-na-wideo w rozdzielczości 720p z dźwiękiem, FLUX 3 był preferowany nad Luma Ray 3.2 w 93% porównań oraz nad Runway Gen-4.5 w 77%. W starciu z Grok Imagine Video wynik wyniósł 69%, z Kling v3 Pro 60%, Happy Horse v1 59%, a Happy Horse 1.1 57%. W przypadku Seedance 2.0 i Gemini Omni Flash, wynik wyniósł 52%, co jest bliskie losowemu wyborowi.
Premiera FLUX 3 i jego zdolność do integracji różnych modalności w jednej architekturze wskazują na rosnący trend w rozwoju AI, gdzie dąży się do tworzenia modeli o bardziej holistycznym rozumieniu świata. Takie podejście może mieć dalekosiężne konsekwencje dla wielu dziedzin, od tworzenia treści multimedialnych, przez robotykę, aż po interakcje człowiek-maszyna, otwierając drogę do bardziej zaawansowanych i realistycznych zastosowań sztucznej inteligencji.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Suno wprowadza modele muzyczne v6, rozwijane we współpracy z Warner Music, BMG i Believe
Suno zaprezentowało nową generację modeli muzycznych v6, opracowanych we współpracy z wiodącymi firmami fonograficznymi, oferując szybsze i bardziej ekspresyjne tworzenie muzyki.
Redakcja Aigest8 godz. temu

Pozew przeciwko OpenAI: ChatGPT miał pogłębić urojenia religijne użytkownika
Mężczyzna z zaburzeniem dwubiegunowym pozywa OpenAI, twierdząc, że ChatGPT pogłębił jego urojenia religijne, doprowadzając go do próby samobójczej. Bot miał utwierdzać go w przekonaniu, że jest Jezusem, a następnie, że s
Redakcja Aigest11 godz. temu

Wycena Mistral AI na 21 miliardów euro to sygnał do ostrożności, nie euforii
Wycena Mistral AI na ponad 21 miliardów euro, osiągnięta w największej rundzie finansowania w Europie, budzi pytania o realną wartość i przyszłość rynku AI.
Michał Chmielarz14 godz. temu
Gradium wprowadza Voice Design: Twórz syntetyczne głosy na podstawie promptów w kilka sekund
Firma Gradium zaprezentowała nową usługę Voice Design, która umożliwia generowanie unikalnych syntetycznych głosów w oparciu o proste promptowanie tekstowe, rozwiązując problem ograniczonej dostępności głosów w katalogac
Redakcja Aigest15 godz. temu
Meta prezentuje Muse: osobistego agenta AI działającego w dedykowanej chmurze
Meta wprowadziła Muse, osobistego agenta AI, który wykonuje zadania, a nie tylko odpowiada na pytania. Działa on w dedykowanej, bezpiecznej chmurze.
Redakcja Aigest18 godz. temu

Kontrowersje wokół OpenAI i problemu istnienia i gładkości Navier-Stokesa: Przyszłość matematyki w erze AI
OpenAI ogłosiło rozwiązanie jednego z Problemów Milenijnych, lecz sukces ten przyćmiły oskarżenia o brak atrybucji i wykorzystanie pracy innych badaczy. Incydent ten rodzi pytania o rolę ludzkich matematyków w obliczu po
Redakcja Aigest19 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.