Aigest.
Newsy

Black Forest Labs prezentuje FLUX 3: Multimodalny model AI do przewidywania obrazu, wideo, dźwięku i akcji robotów

Black Forest Labs (BFL) wprowadziło na rynek FLUX 3, multimodalny model fundamentowy, który integruje przetwarzanie obrazu, wideo i dźwięku w jednej architekturze, oferując jednocześnie przewidywanie akcji.

RA

Udostępnij
Black Forest Labs prezentuje FLUX 3: Multimodalny model AI do przewidywania obrazu, wideo, dźwięku i akcji robotów
Fot. MarkTechPost

Black Forest Labs (BFL) ogłosiło premierę FLUX 3, przełomowego multimodalnego modelu fundamentowego, który uczy się z obrazów, wideo i dźwięku w ramach jednej, spójnej architektury. Jest to pierwszy model FLUX, który dostarcza funkcje przewidywania wideo, audio i akcji z jednego zestawu wag, co stanowi znaczący krok w rozwoju sztucznej inteligencji.

Integracja modalności dla pełniejszego zrozumienia świata

Zespół badawczy Black Forest Labs podkreśla, że żadna pojedyncza modalność nie jest w stanie zapewnić kompletnego opisu świata. Obrazy rejestrują strukturę przestrzenną w danej chwili, wideo dodaje wymiar czasu i ujawnia dynamikę fizyczną, natomiast dźwięk odkrywa związki przyczynowo-skutkowe między zdarzeniami mechanicznymi a ich brzmieniem. Każda z tych modalności jest traktowana jako częściowa projekcja tej samej, bazowej rzeczywistości. Trenowanie modelu na wszystkich tych danych jednocześnie sprawia, że modalności wzajemnie się uzupełniają i ograniczają. Dźwięk musi odpowiadać uderzeniu, a ruch musi być zgodny z masą. FLUX 3 jest pierwszym modelem BFL zbudowanym w całości na tej zasadzie.

Architektura i skalowanie FLUX 3

FLUX 3 bazuje na metodzie Self-Flow, opracowanej przez BFL, która ma na celu ujednolicenie generowania i rozumienia multimodalnego w jednej architekturze. Self-Flow łączy cel dopasowania przepływu (flow matching objective) z celem samonadzorowanej rekonstrukcji cech. Implementacja referencyjna na GitHubie jest dostępna na licencji Apache-2.0 i wykorzystuje SiT-XL/2 z warunkowaniem kroku czasowego dla każdego tokena. Model jest trenowany z 25% współczynnikiem maskowania tokenów i samodystylacją z nauczyciela EMA na warstwie 20 do ucznia na warstwie 8. Warto zaznaczyć, że Self-Flow zostało wprowadzone już w marcu 2026 roku, więc nie jest nowością. Nowością w przypadku FLUX 3 jest skala, w jakiej BFL zastosowało to podejście, znacznie zwiększając zasoby obliczeniowe i dane do jednoczesnego trenowania modelu na wideo, obrazach i dźwięku.

Możliwości generatywne i wyniki preferencji użytkowników

FLUX 3 oferuje zaawansowane możliwości generowania wideo, tworząc klipy o długości do 20 sekund z natywnym dźwiękiem w ramach jednej generacji. Obsługiwane tryby obejmują:

  • Tekst na wideo
  • Obraz na wideo
  • Wideo na wideo (z klipu referencyjnego)
  • Klatka kluczowa na wideo (dla kontrolowanych przejść)
  • Generatywna kontynuacja wideo-audio (na podstawie wejściowego wideo i audio)

Ponadto BFL wymienia takie funkcje jak wielojęzyczny dialog, łączenie klipów w sekwencje wieloklatkowe oraz generowanie silnej typografii z animowanymi projektami. Zespół BFL podkreśla szczególną siłę modelu w odwzorowywaniu ludzkich mimik oraz w kojarzeniu dźwięków z wydarzeniami fizycznymi.

Black Forest Labs opublikowało również wstępne wyniki preferencji użytkowników. W testach, gdzie porównywano 10-sekundowe klipy tekst-na-wideo w rozdzielczości 720p z dźwiękiem, FLUX 3 był preferowany nad Luma Ray 3.2 w 93% porównań oraz nad Runway Gen-4.5 w 77%. W starciu z Grok Imagine Video wynik wyniósł 69%, z Kling v3 Pro 60%, Happy Horse v1 59%, a Happy Horse 1.1 57%. W przypadku Seedance 2.0 i Gemini Omni Flash, wynik wyniósł 52%, co jest bliskie losowemu wyborowi.

Premiera FLUX 3 i jego zdolność do integracji różnych modalności w jednej architekturze wskazują na rosnący trend w rozwoju AI, gdzie dąży się do tworzenia modeli o bardziej holistycznym rozumieniu świata. Takie podejście może mieć dalekosiężne konsekwencje dla wielu dziedzin, od tworzenia treści multimedialnych, przez robotykę, aż po interakcje człowiek-maszyna, otwierając drogę do bardziej zaawansowanych i realistycznych zastosowań sztucznej inteligencji.

Źródło: marktechpost.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

KwaiKAT Team prezentuje KAT-Coder-V2.5: Model kodujący uczony na ponad 100 000 weryfikowalnych środowiskach
Newsy

KwaiKAT Team prezentuje KAT-Coder-V2.5: Model kodujący uczony na ponad 100 000 weryfikowalnych środowiskach

Zespół KwaiKAT z Kuaishou wprowadził KAT-Coder-V2.5, model kodujący działający w rzeczywistych repozytoriach, oraz jego otwartą wersję KAT-Coder-V2.5-Dev.

Redakcja Aigest10 godz. temu

Claude Opus 5 firmy Anthropic ustanawia nowy rekord w teście ARC-AGI-3, wyprzedzając konkurencję
Photon-1 od Induction Labs: Model AI symulujący pulpity i fizykę na podstawie surowego wideo
Newsy

Photon-1 od Induction Labs: Model AI symulujący pulpity i fizykę na podstawie surowego wideo

Induction Labs zaprezentowało Photon-1, model AI trenowany na surowym wideo, który potrafi symulować środowiska komputerowe, grać w warcaby i modelować fizykę bilarda, osiągając lepsze wyniki niż konkurencyjne rozwiązani

Redakcja Aigest12 godz. temu

ChatGPT dostarczał instrukcje tworzenia broni biologicznej i trucizn
Niestabilna sieć energetyczna to realne zagrożenie dla rozwoju centrów danych AI
Bibliotekarze uczą, jak wyłączyć sztuczną inteligencję w urządzeniach

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.