Aigest.
Newsy

Xiaomi MiLM Plus wprowadza PROVE: Nowe metryki i benchmark do oceny usuwania obiektów z wideo

Zespół MiLM Plus z Xiaomi Inc. opracował PROVE, innowacyjny system oceny modeli usuwania obiektów z wideo, który lepiej odzwierciedla ludzką percepcję.

RA

Udostępnij
Xiaomi MiLM Plus wprowadza PROVE: Nowe metryki i benchmark do oceny usuwania obiektów z wideo
Fot. MarkTechPost

Modele usuwania obiektów z obrazów i wideo rozwijają się w szybszym tempie niż metryki służące do ich oceny. Obecne narzędzia, takie jak PSNR, SSIM, LPIPS, ReMOVE czy CFD, często nieprawidłowo szeregują wyniki, mimo że nowoczesne dyfuzyjne gumki potrafią przekonująco rekonstruować cienie, odbicia i zasłonięte struktury. Główną przyczyną jest strukturalny charakter zadania: usuwanie obiektów jest problemem niedookreślonym, gdzie wiele rekonstrukcji jest wiarygodnych, co oznacza brak pojedynczej „prawdy podstawowej” (ground truth), do której można by porównać wyniki. Aby wypełnić tę lukę, zespół MiLM Plus z Xiaomi Inc. opracował PROVE (Perceptual RemOVal cohErence) – system, który został zaakceptowany na konferencji ACM MM 2026.

Innowacyjne metryki RC-S i RC-T

PROVE łączy dwie metryki zgodne z percepcją człowieka: RC-S (spatial coherence) dla spójności przestrzennej oraz RC-T (temporal consistency) dla spójności czasowej. Obie metryki oceniają edytowany region lokalnie, wykorzystując przesuwne okno Maximum Mean Discrepancy (MMD) na cechach DINOv2. Co istotne, żadna z nich nie wymaga referencyjnego wideo, co jest kluczowe dla problemów niedookreślonych. System jest dostępny jako repozytorium Apache 2.0 PyTorch z jednym punktem wejścia CLI (run_prove_metrics.py) i wymaga Pythona 3.10+, PyTorcha 2.6+, Transformers 4.51+ oraz wag DINOv2-giant. Maski są obowiązkowe, a białe piksele oznaczają usunięty obiekt.

Jak działają metryki?

  • RC-S (przestrzenna): Analiza połączonych komponentów dzieli maskę na niezależne cele. Każde pole ograniczające jest powiększane o jedną trzecią długości boku, a wycinek trafia do DINOv2. Maska jest następnie próbkowana w dół do rozdzielczości cech. Okno o wymiarach w×w przesuwa się po mapie cech, obliczając kwadratowe MMD z jądrem Gaussa RBF między zamaskowanymi a lokalnymi cechami tła. Wyniki są uśredniane dla każdego celu, a następnie dla wszystkich celów.
  • RC-T (czasowa): Sąsiadujące klatki są wspólnie przycinane pod unią ich masek, aby uniknąć niedopasowania. MMD jest obliczane tylko w obszarze przecięcia – regionie przywróconym w obu klatkach. Badania ablacyjne wykazały, że usunięcie operacji przycinania sprawia, że RC-T staje się niewrażliwe na wprowadzane zakłócenia.

Wyniki i benchmark PROVE-Bench

PROVE osiąga znacznie lepsze wyniki w porównaniu z istniejącymi metrykami. W zestawieniu z rankingami ludzkimi, agregowanymi metodą Borda count od 20 uczestników, RC-S osiągnęło średnią Kendall’s τ na poziomie 0,59 i Spearman’s ρ na poziomie 0,66. Dla porównania, ReMOVE uzyskało 0,26/0,29, a CFD 0,16/0,18. RC-S zajmuje pierwsze miejsce w pięciu z sześciu benchmarków. Co więcej, na zbiorze danych RORD-Val, RC-S preferuje czysty obraz nad rozmyte i zmienione regionalnie w 100% przypadków, podczas gdy ReMOVE osiąga 60,06%, a CFD 49,27% w warunkach rozmycia. RC-T reaguje monotonicznie na rosnące zakłócenia, w przeciwieństwie do TC i TF.

Badania ablacyjne wykazały, że DINOv2 (średnie τ 0,59) przewyższa DINOv3 (0,51) i SAM (0,44). Usunięcie przesuwnego okna kosztuje 0,11 punktu, a zamiana MMD na cosinus kosztuje 0,07. RC-S jest również najtańszą przetestowaną metryką przestrzenną, działającą 13,7 razy szybciej niż CFD.

PROVE jest uzupełnione o PROVE-Bench, dwupoziomowy benchmark wideo z rzeczywistego świata:

  • PROVE-M: Zawiera 80 par wideo – nagrania wejściowe z kamery na statywie i nagrania bez obiektu docelowego, wykonane w ciągu dwóch minut. Maski SAM3 są udoskonalane klatka po klatce, a następnie stosowana jest trzystopniowa kontrola jakości. Do trójki stosuje się augmentację ruchu w stylu Ken Burns. Każdy klip ma 81 klatek w rozdzielczości 1080p.
  • PROVE-H: Dodaje 100 trudnych wideo bez prawdy podstawowej, obejmujących sceny takie jak tłumy, płynąca woda, płomienie, teksturowany teren, odbicia w wielu kałużach i szybki ruch. Celowo użyto w nim nieudokładnionych masek SAM3.

Na publicznej tablicy wyników, SVOR (1.3B) prowadzi w połączonym RC-S z wynikiem 0,5197, natomiast EffectErase prowadzi w RC-T z wynikiem 0,2525.

Wprowadzenie PROVE przez Xiaomi MiLM Plus stanowi znaczący krok naprzód w ocenie modeli usuwania obiektów. Dzięki metrykom RC-S i RC-T, które lepiej odzwierciedlają ludzką percepcję i nie wymagają referencyjnych danych, oraz kompleksowemu benchmarkowi PROVE-Bench, branża zyskuje narzędzia do bardziej precyzyjnego i wiarygodnego rozwoju systemów edycji wideo. To otwiera drogę do tworzenia bardziej realistycznych i spójnych wizualnie aplikacji, które będą w stanie sprostać rosnącym oczekiwaniom użytkowników w zakresie manipulacji treściami multimedialnymi.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Google Vids wprowadza spersonalizowane awatary AI i model Gemini Omni
Nvidia gwarantuje wartość chipów, by utrzymać dynamikę rozwoju AI
Aplikacja Gemini Google'a przekroczyła miliard użytkowników
Brad Lightcap, wieloletni COO OpenAI, odchodzi, aby „rozpocząć coś nowego”
Newsy

Brad Lightcap, wieloletni COO OpenAI, odchodzi, aby „rozpocząć coś nowego”

Brad Lightcap, jeden z najdłużej pracujących menedżerów w OpenAI, ogłosił swoje odejście z firmy, aby zająć się nowymi przedsięwzięciami, co wpisuje się w szersze zmiany kadrowe w spółce.

Redakcja Aigest15 godz. temu

Ujawniono wrażliwość w API wiodących modeli AI: wyciek haseł i wgląd w ukryte procesy myślowe
Newsy

Ujawniono wrażliwość w API wiodących modeli AI: wyciek haseł i wgląd w ukryte procesy myślowe

Badacze bezpieczeństwa odkryli lukę w API wszystkich głównych dostawców AI, która pozwala na odczytywanie zaszyfrowanych procesów myślowych modeli, prowadząc do wycieku danych uwierzytelniających i ujawniając nieoczekiwa

Redakcja Aigest15 godz. temu

Nvidia gwarantuje wartość swoich chipów, by odblokować 500 mld dolarów finansowania infrastruktury AI
Newsy

Nvidia gwarantuje wartość swoich chipów, by odblokować 500 mld dolarów finansowania infrastruktury AI

Nvidia zawarła porozumienia z sześcioma gigantami finansowymi, w tym BlackRock i Goldman Sachs, w celu pozyskania ponad 500 miliardów dolarów na rozwój infrastruktury AI. Firma będzie gwarantować część wartości rezydualn

Redakcja Aigest23 godz. temu

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.