Aigest.
Newsy

Gander od Tencent: AI, która rozmawia i pracuje jednocześnie

Tencent wprowadza Gander, model AI łączący konwersację w czasie rzeczywistym z możliwościami agenta. System dzieli zadania między „móżdżek” i „mózg”, umożliwiając płynną interakcję.

RA

Udostępnij
Gander od Tencent: AI, która rozmawia i pracuje jednocześnie
Fot. The Decoder

Tencent zaprezentował Gander, innowacyjny model sztucznej inteligencji, który ma na celu zrewolucjonizowanie interakcji z asystentami głosowymi. Gander łączy możliwości prowadzenia rozmowy w czasie rzeczywistym z wykonywaniem złożonych zadań w tle, umożliwiając użytkownikom płynne przerywanie i otrzymywanie aktualizacji bez konieczności czekania na zakończenie operacji.

Obecne asystenty głosowe zazwyczaj działają na zasadzie tury, co oznacza, że użytkownik musi czekać, aż asystent zakończy swoją wypowiedź lub zadanie. Badacze z zespołu Hunyuan Speech Tencent oraz naukowcy z kilku uniwersytetów, którzy stworzyli Gander, podkreślają, że w naturalnych rozmowach ludzie często się przerywają, udzielają szybkich informacji zwrotnych i słuchają, jednocześnie mówiąc. Gander został zaprojektowany tak, aby naśladować tę dynamikę, przetwarzając jednocześnie mowę, obraz i tekst, nawet podczas własnej wypowiedzi.

Architektura Gander: móżdżek i mózg

Kluczem do działania Gander jest jego unikalna architektura, inspirowana anatomią człowieka. Model dzieli pracę na dwie główne części:

  • „Móżdżek” (cerebellum): Odpowiada za prowadzenie konwersacji w czasie rzeczywistym, zapewniając szybkie reakcje i płynność dialogu. Przetwarza on rozmowę w jednusekundowych segmentach, decydując, kiedy słuchać, mówić lub przerwać, jeśli użytkownik interweniuje. Wykorzystuje pamięć z około ostatnich dwóch minut rozmowy, aby podejmować te decyzje bez dedykowanego modułu wykrywania początku i końca mowy.
  • „Mózg” (brain): Zajmuje się rozumowaniem i wykonywaniem złożonych zadań w tle, takich jak wyszukiwanie plików czy pisanie kodu. Co istotne, „mózg” może być wymieniany na inne systemy agentów, takie jak Codex czy Claude Code, bez konieczności ponownego trenowania modelu konwersacyjnego. W testach wykorzystano nieokreślony model z rodziny GPT-5.6 OpenAI, co sugeruje elastyczność i możliwość adaptacji do postępów w technologiach bazowych.

Rozdzielenie tych funkcji pozwala Gander na zrównoważenie potrzeby szybkiej reakcji w konwersacji z czasem potrzebnym na planowanie i wykonanie skomplikowanych zadań. Według raportu technicznego, Gander jednocześnie przyjmuje dane wejściowe w postaci mowy, obrazów i tekstu.

Wyniki testów i wyzwania

Ponieważ nie istnieją jeszcze dedykowane benchmarki dla modeli takich jak Gander, badacze wykorzystali istniejące testy. Gander osiągnął najlepsze wyniki w testach płynności konwersacji na platformie Full-Duplex-Bench v3, która ocenia asystentów głosowych w różnych scenariuszach zadań. Model:

  • Rozpoczyna mówić w odpowiednim momencie we wszystkich 100 scenariuszach.
  • Przerywa użytkownikom w 8% przypadków, co jest znacznie lepszym wynikiem niż 13,5% dla GPT-Realtime i prawie 48% dla najsłabszego konkurenta.

Raport podkreśla, że Gander wykorzystuje stosunkowo mały model, aby konkurować z komercyjnymi systemami, takimi jak GPT-Realtime, Gemini Live i Grok.

Jednak Gander nieco ustępuje w dokładności wykonywania zadań. Badacze tłumaczą to częściowo tym, że testy oceniają cały system, więc błędy w rozpoznawaniu mowy i generowaniu wyników wpływają na ogólny wynik. „Mózg” osiąga znacznie lepsze rezultaty, gdy otrzymuje tekst bezpośrednio. Model również gorzej radzi sobie ze zrozumieniem wideo i audio niż jego bazowy model, co jest przypisywane treningowi faworyzującemu płynną konwersację nad precyzyjną percepcją, np. w zadaniach liczenia obiektów czy lokalizowania ich na obrazie.

Model Gander został wytrenowany na około 2,7 miliona przykładów, ucząc się m.in. zachowania ciszy w przypadku szumów tła lub gdy nikt w grupie się do niego nie zwraca.

Przyszłość i kontekst rynkowy

Badacze podkreślają, że prace nad Gander są wciąż na wczesnym etapie. Skalowanie modelu i standaryzacja metod jego oceny pozostają otwartymi pytaniami. Zespół planuje udostępnić wagi i dane treningowe po zakończeniu procesu otwartego udostępniania, a repozytorium GitHub z kodem i demami już istnieje.

Premiera Gander wpisuje się w szerszą strategię Tencent w dziedzinie AI. W lipcu firma udostępniła Hy3, otwarty model językowy, który zmniejszył dystans do konkurencji, zwłaszcza w zadaniach agentowych. Hy3 jest już wykorzystywany w aplikacjach takich jak WorkBuddy, Yuanbao i WeChat. Tencent negocjuje również przejęcie największego pakietu udziałów w startupie Manus, widząc w tym szansę na wdrożenie agenta w WeChat. Inne firmy, takie jak OpenAI z GPT-Live czy Sakana AI z Fugu, również rozwijają podobne koncepcje, oddzielając konwersację od rozumowania i delegując zadania do modeli działających w tle.

Rozwój Gander i podobnych systemów wskazuje na rosnące zapotrzebowanie na bardziej naturalne i efektywne interfejsy AI. Zdolność do płynnej, dwukierunkowej komunikacji, przy jednoczesnym wykonywaniu złożonych zadań, może znacząco poprawić użyteczność asystentów głosowych i agentów AI, czyniąc interakcje z technologią bardziej intuicyjnymi i mniej frustrującymi dla użytkowników.

Źródło: the-decoder.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Alibaba prezentuje Qwen-Image-2.1: otwarty model AI do generowania i edycji obrazów
Runway dąży do generowania wideo AI w czasie rzeczywistym, niczym transmisja na żywo
Codzienne użycie AI w USA wzrosło ponad dwukrotnie w pół roku
Newsy

Codzienne użycie AI w USA wzrosło ponad dwukrotnie w pół roku

Badania przeprowadzone przez Epoch AI i Ipsos wskazują na znaczący wzrost codziennego korzystania ze sztucznej inteligencji wśród dorosłych Amerykanów w ciągu zaledwie sześciu miesięcy.

Redakcja Aigest9 godz. temu

StudentSim: Microsoft i Uniwersytet Illinois tworzą realistyczne cyfrowe repliki studentów do szkolenia korepetytorów AI
Nawet w wojsku halucynacje AI to realne zagrożenie, nie tylko ciekawostka
Qwen3.8-LiveTranslate: Alibaba prezentuje model do tłumaczeń symultanicznych z opóźnieniem 2,3 sekundy
Newsy

Qwen3.8-LiveTranslate: Alibaba prezentuje model do tłumaczeń symultanicznych z opóźnieniem 2,3 sekundy

Zespół Qwen firmy Alibaba wprowadził na rynek Qwen3.8-LiveTranslate, innowacyjny model do tłumaczeń symultanicznych w czasie rzeczywistym, który znacząco redukuje opóźnienia i oferuje zaawansowane funkcje.

Redakcja Aigest13 godz. temu

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.