Aigest.
Newsy

ByteDance Seed prezentuje SeedRealtime: multimodalny LLM do interakcji w czasie rzeczywistym

Zespół Seed firmy ByteDance wprowadził SeedRealtime, natywny, audiowizualny, pełnodupleksowy model językowy (LLM), który integruje dźwięk, obraz i tekst w jednej architekturze.

RA

Udostępnij
ByteDance Seed prezentuje SeedRealtime: multimodalny LLM do interakcji w czasie rzeczywistym
Fot. MarkTechPost

Zespół Seed firmy ByteDance zaprezentował SeedRealtime, natywny, audiowizualny, pełnodupleksowy duży model językowy (LLM). Model ten integruje dźwięk, obraz i tekst w ramach jednej, ujednoliconej architektury, umożliwiając interakcję w czasie rzeczywistym poprzez ciągłe strumienie multimodalne, zamiast działać w trybie pojedynczych tur. ByteDance pozycjonuje SeedRealtime jako krok w kierunku interakcji typu „omni-modal” i podkreśla trzy kluczowe osiągnięcia: wspólne rozumienie audiowizualne, proaktywną interakcję oraz naturalne wyczucie czasu w konwersacji.

Przełom w architekturze i działaniu

Tradycyjne podejścia opierają się na architekturze kaskadowej, gdzie moduły takie jak automatyczne rozpoznawanie mowy (ASR), wizualne modele językowe (VLM) i synteza mowy (TTS) są ze sobą połączone. Taka konfiguracja wprowadza opóźnienia i prowadzi do utraty informacji między kolejnymi etapami. SeedRealtime odchodzi od tego schematu, realizując percepcję, rozumienie, podejmowanie decyzji i ekspresję równolegle, w ramach jednego, kompleksowego modelu. Co więcej, zarządzanie zmianą ról w konwersacji (tzw. „turn-taking”) również odbywa się wewnętrznie w modelu, eliminując potrzebę zewnętrznych detektorów aktywności głosowej, na których wciąż polega większość systemów działających w czasie rzeczywistym.

Dostępność i potencjał rynkowy

Obecnie SeedRealtime jest zaimplementowany w aplikacji Doubao, asystencie konsumenckim firmy ByteDance. Warto zaznaczyć, że ByteDance nie opublikował jeszcze raportu technicznego dotyczącego tego konkretnego modelu, nie podał liczby parametrów ani nie udostępnił otwartych wag. Nie ma również możliwości integracji modelu przez zewnętrzne zespoły za pośrednictwem Volcano Engine czy BytePlus. Mimo to, ByteDance podkreśla, że kluczową wartością, która jest już dostępna, jest sama idea – zweryfikowana architektura referencyjna, która podnosi poprzeczkę dla wszystkich firm rozwijających produkty głosowe i wizualne działające w czasie rzeczywistym.

Scenariusze zastosowania

Zespół Seed przedstawił siedem scenariuszy zastosowania SeedRealtime, z czego cztery uznano za kluczowe. Chociaż szczegóły tych scenariuszy nie zostały podane, ich istnienie wskazuje na szerokie spektrum potencjalnych aplikacji, w których model może znaleźć zastosowanie, od asystentów głosowych po interaktywne systemy wizyjne. Rozwój takich technologii, integrujących wiele modalności w jednym modelu, stanowi istotny krok w ewolucji interakcji człowiek-komputer, otwierając drogę do bardziej naturalnych i płynnych doświadczeń użytkownika.

Źródło: marktechpost.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Meta AI prezentuje Muse Glimmer: model agentowy 30B działający na pojedynczej karcie GPU
Australijski agent AI zhakował system rezerwacji siłowni, aby przesunąć użytkownika w kolejce
Recenzowanie naukowe w kryzysie: Czy system peer review przetrwa erę AI?
Startupy rewolucjonizują LLM-y: Nadchodzi nowa generacja modeli językowych
Newsy

Startupy rewolucjonizują LLM-y: Nadchodzi nowa generacja modeli językowych

W obliczu rosnących kosztów i ograniczeń obecnych modeli językowych, nowe startupy opracowują innowacyjne rozwiązania, które mają zastąpić lub znacząco ulepszyć technologię transformatorów.

Redakcja Aigest12 godz. temu

Agenty AI zrewolucjonizują naukę, wykraczając poza podejście oparte na danych
Agenty AI to nowa granica, która wymaga równie nowej strategii bezpieczeństwa

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.