Aigest.
Newsy

Nunchux AI prezentuje VC-Attention: Nowy kernel przyspieszający wideo Diffusion Transformers

Firma Nunchux AI wprowadziła VC-Attention, innowacyjny kernel uwagi, który ma za zadanie przyspieszyć działanie wideo Diffusion Transformers (DiT), rozwiązując jednocześnie dwa kluczowe problemy.

RA

Udostępnij
Nunchux AI prezentuje VC-Attention: Nowy kernel przyspieszający wideo Diffusion Transformers
Ilustracja poglądowa

Firma Nunchux AI ogłosiła premierę VC-Attention, innowacyjnego kernela uwagi o niskiej precyzji bitowej, który nie wymaga dodatkowego treningu. Rozwiązanie to zostało stworzone z myślą o akceleracji działania wideo Diffusion Transformers (DiT) i ma na celu jednoczesne wyeliminowanie dwóch kluczowych problemów: błędu kwantyzacji wartości oraz spowolnienia na etapie funkcji softmax.

Dlaczego uwaga jest wąskim gardłem w przetwarzaniu wideo?

Wideo Diffusion Transformers (DiT) przetwarzają klipy wideo w specyficzny sposób. Polega to na spłaszczaniu sekwencji klatek wideo do postaci jednego długiego ciągu tokenów czasoprzestrzennych. Następnie, na każdej warstwie modelu, wykonywane jest pełne self-attention (samouważność). Ten proces, choć kluczowy dla zrozumienia kontekstu wideo, jest również głównym czynnikiem spowalniającym działanie tych zaawansowanych modeli. Złożoność obliczeniowa operacji uwagi, zwłaszcza w przypadku długich sekwencji tokenów generowanych z wideo, staje się znaczącym wyzwaniem, prowadząc do długiego czasu przetwarzania i wysokiego zużycia zasobów.

VC-Attention: Rozwiązanie dwóch problemów

VC-Attention zostało zaprojektowane, aby sprostać dwóm głównym wyzwaniom, które ograniczają wydajność wideo DiT:

  • Błąd kwantyzacji wartości: W modelach głębokiego uczenia, zwłaszcza tych optymalizowanych pod kątem wydajności, często stosuje się kwantyzację, czyli redukcję precyzji liczbowej. Może to jednak prowadzić do utraty informacji i błędów. VC-Attention ma za zadanie minimalizować negatywne skutki tej kwantyzacji w kontekście wartości używanych w mechanizmach uwagi.
  • Wolny etap softmax: Funkcja softmax jest integralną częścią mechanizmu uwagi, odpowiadającą za normalizację wag. Jej obliczenia mogą być kosztowne, szczególnie przy dużej liczbie tokenów. Nowy kernel Nunchux AI ma zoptymalizować ten etap, znacząco przyspieszając cały proces.

Wprowadzenie VC-Attention przez Nunchux AI stanowi ważny krok w kierunku zwiększenia efektywności modeli generatywnych wideo. Poprawa szybkości i redukcja błędów kwantyzacji mogą otworzyć nowe możliwości dla zastosowań wideo Diffusion Transformers, od generowania realistycznych treści po bardziej złożone analizy wideo, czyniąc te technologie bardziej dostępnymi i praktycznymi w codziennym użytkowaniu.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Google Gemini Flash z nową funkcją agentowego rozumienia wideo: oszczędność tokenów do 88%
Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność
Google udostępnia Gemini Omni 1.1 Flash: Większa kontrola nad generowaniem wideo AI
Xiaomi MiLM Plus wprowadza PROVE: Nowe metryki i benchmark do oceny usuwania obiektów z wideo
Google Vids wprowadza spersonalizowane awatary AI i model Gemini Omni
DeepSeek prezentuje DSpark: przyspieszenie generowania DeepSeek-V4 o 60-85%

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.