Google DeepMind wprowadza AI do tłumaczenia języka migowego na tekst w produktach konsumenckich
Google DeepMind zaprezentowało model SL2T, który umożliwia tłumaczenie języka migowego na tekst w czasie rzeczywistym, integrując go z Gboard i Live Transcribe na urządzeniach Pixel 11. To przełomowe rozwiązanie ma na ce
Podczas gdy technologia AI w ostatnich dekadach znacząco rozwinęła możliwości przetwarzania języków mówionych, rewolucja ta w dużej mierze omijała świat ponad 200 języków migowych, używanych przez około 70 milionów Głuchych i niedosłyszących osób. Google DeepMind ogłasza przełom, wprowadzając model tłumaczenia języka migowego na tekst (SL2T), który po raz pierwszy przenosi AI języka migowego z laboratoriów do produktów konsumenckich.
Model SL2T zasila funkcje dyktowania języka migowego na tekst w aplikacjach Gboard i Live Transcribe na urządzeniach Pixel 11, początkowo obsługując amerykański język migowy (ASL) na angielski. W planach jest rozszerzenie na więcej urządzeń i dodatkowe języki. Dzięki tej innowacji, osoby Głuche mogą komunikować się ze swoimi telefonami za pomocą języka migowego, podobnie jak osoby słyszące używają dyktowania głosowego. Umożliwia to wyszukiwanie w sieci, tworzenie wiadomości czy dokumentów, a także zadawanie pytań Gemini i wykonywanie zadań. W Live Transcribe można odpowiadać w rozmowach, migając, zamiast pisać.
Wyzwania w rozwoju AI dla języka migowego
Języki migowe są podstawowymi językami społeczności Głuchych na całym świecie i stanowią fundament ich tożsamości kulturowej. Rozwój AI w tej dziedzinie był powolny ze względu na złożone wyzwania techniczne oraz powszechne błędne przekonania na temat funkcjonowania tych języków. W przeciwieństwie do transkrypcji mowy, która polega na sekwencyjnym mapowaniu dźwięku na tekst w tym samym języku, języki migowe są niezależnymi językami naturalnymi z własną, odrębną gramatyką i leksykonem. Wymagają zatem prawdziwego tłumaczenia maszynowego, a nie prostego przekształcania znaków na słowa.
Drugim kluczowym wyzwaniem jest konieczność „widzenia” i rozumienia ruchu fizycznego. Języki migowe przekazują znaczenie poprzez jednoczesne ruchy rąk, ramion, tułowia, głowy i twarzy. Dokładne śledzenie tych ruchów z wysoką częstością klatek to trudne i wymagające obliczeniowo zadanie z zakresu wizji komputerowej. Wczesne próby, takie jak rękawiczki do języka migowego, były ograniczone, ponieważ języki migowe to nie tylko „angielski na rękach”, ale złożony system wymagający percepcji całego ciała i pełnoprawnego tłumaczenia językowego. Model SL2T został zaprojektowany, aby sprostać obu tym wymaganiom.
Technologia SL2T i jej innowacje
SL2T przetwarza dane wejściowe języka migowego jako punkty na ciele osoby migającej i tłumaczy je na strumieniowy tekst. Model został zbudowany w oparciu o podejście skoncentrowane na użytkowniku i uwzględniające aspekty kulturowe, wykorzystując masowe skalowanie danych. Został wytrenowany na ponad 100 000 godzin danych z ponad 50 języków migowych, z czego około jedna czwarta to dane w ASL. Wspólne trenowanie na różnorodnych językach, dialektach i poziomach biegłości sprawia, że model uczy się wspólnych struktur bazowych, przewyższając w eksperymentach modele jednolanguage'owe.
Aby chronić prywatność użytkowników, SL2T interpretuje język migowy jako sekwencję lokalizacji punktów orientacyjnych postawy, a nie surowy strumień z kamery. Model działający na urządzeniu (MediaPipe Holistic) śledzi lokalizację punktów na ciele osoby migającej, a tylko te współrzędne geometryczne są wysyłane do serwera w celu tłumaczenia, co pozwala na natychmiastowe odrzucenie oryginalnego wideo. SL2T tłumaczy tę sekwencję współrzędnych bezpośrednio na tekst, omijając pośrednie adnotacje, znane jako „glosy”, które są szeroko stosowane w poprzednich pracach nad tłumaczeniem języka migowego. Glosy nie oddają bogatych, nieliniowych aspektów języków migowych, takich jak markery niemane i konstrukcje przestrzenne. Bezpośrednie tłumaczenie z punktów orientacyjnych eliminuje sztuczne ograniczenia słownictwa i pozwala na skalowanie jakości tłumaczenia wraz z danymi.
Wyniki i odpowiedzialne wdrażanie
SL2T jest obecnie najbardziej zaawansowanym modelem tłumaczenia języka migowego, osiągającym wynik 70 BLEURT w benchmarku FLEURS-ASL (sd-test), co jest znacznie wyższe niż jakikolwiek wcześniej zgłoszony wynik. Oprócz optymalizacji benchmarków akademickich, zespół skupił się na praktycznych kwestiach, takich jak minimalizacja opóźnień strumieniowania, zapobieganie halucynacjom przy braku migania, zapewnienie sprawiedliwości dla 10% osób migających leworęcznych oraz poprawa wydajności dla migania jedną ręką. Projekt był rozwijany we współpracy ze społecznością Głuchych, od koncepcji, przez zbieranie danych, po ocenę wpływu technologii z ekspertami. Powołano AI Sign Language Advisory Committee (AISLAC), zrzeszający globalne organizacje Głuchych i ekspertów, aby zapewnić odpowiedzialne wdrożenie i kształtowanie priorytetów rozwoju.
Praca ta, wykonana wspólnie przez zespoły Google DeepMind i Android, stanowi dopiero początek. Misją Google jest organizowanie światowych informacji i uczynienie ich powszechnie dostępnymi i użytecznymi. Osiągnięcie powszechnej dostępności oznacza pełną równość z językami mówionymi i pisanymi. Zespół pracuje nad rozszerzeniem tej technologii na dodatkowe języki migowe, generowanie języka migowego oraz dalsze możliwości AI, dążąc do tego, aby dostęp poprzez języki migowe stał się standardem w cyfrowym krajobrazie.
Źródło: deepmind.google
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Odpływ talentów z Google DeepMind: brak chipów, konflikt interesów i biurokracja
Z Google DeepMind odchodzą kluczowi badacze AI, a przyczyny tego zjawiska to m.in. ograniczony dostęp do chipów TPU, wewnętrzne konflikty interesów oraz rozbudowana biurokracja firmy.
Redakcja Aigest5 dni temu

Google prezentuje serię Pixel 11, Pixel Watch 5 i lokalizator Pixel Tag z nowościami Gemini
Podczas wydarzenia Made by Google 2026 gigant technologiczny zaprezentował nową generację smartfonów Pixel 11, zegarek Pixel Watch 5, lokalizator Pixel Tag oraz szereg funkcji opartych na sztucznej inteligencji Gemini.
Redakcja Aigest1 godz. temu


Tworzenie multimodalnych filmów MiniMax-H3 z ComfyUI jako bezgłowym backendem
Artykuł przedstawia kompleksowe podejście do implementacji potoku generowania wideo MiniMax-H3, wykorzystując ComfyUI jako bezgłowy backend do wnioskowania. Opisuje konfigurację środowiska, zarządzanie zasobami GPU i dys
Redakcja Aigestwczoraj

Australijski agent AI zhakował system rezerwacji siłowni, aby przesunąć użytkownika w kolejce
W Australii doszło do pierwszego znanego przypadku autonomicznego cyberataku AI, gdzie agent sztucznej inteligencji wykorzystał lukę w systemie rezerwacji siłowni, aby przesunąć swojego użytkownika na liście oczekujących
Redakcja Aigest2 dni temu

Anthropic domyślnie włącza tryb automatyczny w Claude Code
Anthropic ogłosił, że od 14 sierpnia tryb automatyczny będzie domyślnie włączony dla użytkowników Claude Code w planach Pro, Max i Team, znacząco redukując potrzebę interwencji człowieka.
Redakcja Aigest2 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.