Gander od Tencent: AI, która rozmawia i pracuje jednocześnie
Tencent wprowadza Gander, model AI łączący konwersację w czasie rzeczywistym z możliwościami agenta. System dzieli zadania między „móżdżek” i „mózg”, umożliwiając płynną interakcję.

Tencent zaprezentował Gander, innowacyjny model sztucznej inteligencji, który ma na celu zrewolucjonizowanie interakcji z asystentami głosowymi. Gander łączy możliwości prowadzenia rozmowy w czasie rzeczywistym z wykonywaniem złożonych zadań w tle, umożliwiając użytkownikom płynne przerywanie i otrzymywanie aktualizacji bez konieczności czekania na zakończenie operacji.
Obecne asystenty głosowe zazwyczaj działają na zasadzie tury, co oznacza, że użytkownik musi czekać, aż asystent zakończy swoją wypowiedź lub zadanie. Badacze z zespołu Hunyuan Speech Tencent oraz naukowcy z kilku uniwersytetów, którzy stworzyli Gander, podkreślają, że w naturalnych rozmowach ludzie często się przerywają, udzielają szybkich informacji zwrotnych i słuchają, jednocześnie mówiąc. Gander został zaprojektowany tak, aby naśladować tę dynamikę, przetwarzając jednocześnie mowę, obraz i tekst, nawet podczas własnej wypowiedzi.
Architektura Gander: móżdżek i mózg
Kluczem do działania Gander jest jego unikalna architektura, inspirowana anatomią człowieka. Model dzieli pracę na dwie główne części:
- „Móżdżek” (cerebellum): Odpowiada za prowadzenie konwersacji w czasie rzeczywistym, zapewniając szybkie reakcje i płynność dialogu. Przetwarza on rozmowę w jednusekundowych segmentach, decydując, kiedy słuchać, mówić lub przerwać, jeśli użytkownik interweniuje. Wykorzystuje pamięć z około ostatnich dwóch minut rozmowy, aby podejmować te decyzje bez dedykowanego modułu wykrywania początku i końca mowy.
- „Mózg” (brain): Zajmuje się rozumowaniem i wykonywaniem złożonych zadań w tle, takich jak wyszukiwanie plików czy pisanie kodu. Co istotne, „mózg” może być wymieniany na inne systemy agentów, takie jak Codex czy Claude Code, bez konieczności ponownego trenowania modelu konwersacyjnego. W testach wykorzystano nieokreślony model z rodziny GPT-5.6 OpenAI, co sugeruje elastyczność i możliwość adaptacji do postępów w technologiach bazowych.
Rozdzielenie tych funkcji pozwala Gander na zrównoważenie potrzeby szybkiej reakcji w konwersacji z czasem potrzebnym na planowanie i wykonanie skomplikowanych zadań. Według raportu technicznego, Gander jednocześnie przyjmuje dane wejściowe w postaci mowy, obrazów i tekstu.
Wyniki testów i wyzwania
Ponieważ nie istnieją jeszcze dedykowane benchmarki dla modeli takich jak Gander, badacze wykorzystali istniejące testy. Gander osiągnął najlepsze wyniki w testach płynności konwersacji na platformie Full-Duplex-Bench v3, która ocenia asystentów głosowych w różnych scenariuszach zadań. Model:
- Rozpoczyna mówić w odpowiednim momencie we wszystkich 100 scenariuszach.
- Przerywa użytkownikom w 8% przypadków, co jest znacznie lepszym wynikiem niż 13,5% dla GPT-Realtime i prawie 48% dla najsłabszego konkurenta.
Raport podkreśla, że Gander wykorzystuje stosunkowo mały model, aby konkurować z komercyjnymi systemami, takimi jak GPT-Realtime, Gemini Live i Grok.
Jednak Gander nieco ustępuje w dokładności wykonywania zadań. Badacze tłumaczą to częściowo tym, że testy oceniają cały system, więc błędy w rozpoznawaniu mowy i generowaniu wyników wpływają na ogólny wynik. „Mózg” osiąga znacznie lepsze rezultaty, gdy otrzymuje tekst bezpośrednio. Model również gorzej radzi sobie ze zrozumieniem wideo i audio niż jego bazowy model, co jest przypisywane treningowi faworyzującemu płynną konwersację nad precyzyjną percepcją, np. w zadaniach liczenia obiektów czy lokalizowania ich na obrazie.
Model Gander został wytrenowany na około 2,7 miliona przykładów, ucząc się m.in. zachowania ciszy w przypadku szumów tła lub gdy nikt w grupie się do niego nie zwraca.
Przyszłość i kontekst rynkowy
Badacze podkreślają, że prace nad Gander są wciąż na wczesnym etapie. Skalowanie modelu i standaryzacja metod jego oceny pozostają otwartymi pytaniami. Zespół planuje udostępnić wagi i dane treningowe po zakończeniu procesu otwartego udostępniania, a repozytorium GitHub z kodem i demami już istnieje.
Premiera Gander wpisuje się w szerszą strategię Tencent w dziedzinie AI. W lipcu firma udostępniła Hy3, otwarty model językowy, który zmniejszył dystans do konkurencji, zwłaszcza w zadaniach agentowych. Hy3 jest już wykorzystywany w aplikacjach takich jak WorkBuddy, Yuanbao i WeChat. Tencent negocjuje również przejęcie największego pakietu udziałów w startupie Manus, widząc w tym szansę na wdrożenie agenta w WeChat. Inne firmy, takie jak OpenAI z GPT-Live czy Sakana AI z Fugu, również rozwijają podobne koncepcje, oddzielając konwersację od rozumowania i delegując zadania do modeli działających w tle.
Rozwój Gander i podobnych systemów wskazuje na rosnące zapotrzebowanie na bardziej naturalne i efektywne interfejsy AI. Zdolność do płynnej, dwukierunkowej komunikacji, przy jednoczesnym wykonywaniu złożonych zadań, może znacząco poprawić użyteczność asystentów głosowych i agentów AI, czyniąc interakcje z technologią bardziej intuicyjnymi i mniej frustrującymi dla użytkowników.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Alibaba prezentuje Qwen-Image-2.1: otwarty model AI do generowania i edycji obrazów
Zespół Qwen AI firmy Alibaba udostępnił Qwen-Image-2.1, otwarty model do generowania i edycji obrazów, który ma konkurować z zamkniętymi systemami.
Redakcja Aigest3 godz. temu
Runway dąży do generowania wideo AI w czasie rzeczywistym, niczym transmisja na żywo
Runway intensywnie pracuje nad przekształceniem generowania wideo AI w interaktywny strumień, który użytkownicy mogliby kontrolować w czasie rzeczywistym, eliminując długie oczekiwanie na gotowe klipy.
Redakcja Aigest8 godz. temu

Codzienne użycie AI w USA wzrosło ponad dwukrotnie w pół roku
Badania przeprowadzone przez Epoch AI i Ipsos wskazują na znaczący wzrost codziennego korzystania ze sztucznej inteligencji wśród dorosłych Amerykanów w ciągu zaledwie sześciu miesięcy.
Redakcja Aigest9 godz. temu

StudentSim: Microsoft i Uniwersytet Illinois tworzą realistyczne cyfrowe repliki studentów do szkolenia korepetytorów AI
Microsoft i Uniwersytet Illinois opracowały StudentSim, system tworzący cyfrowe repliki studentów, które pomagają w szybszym i tańszym szkoleniu korepetytorów AI.
Redakcja Aigest10 godz. temu

Nawet w wojsku halucynacje AI to realne zagrożenie, nie tylko ciekawostka
Błędny raport wywiadowczy, wygenerowany częściowo przez AI, omal nie doprowadził do międzynarodowego incydentu. To sygnał, że "halucynacje" to nie tylko problem marketingowy, ale realne zagrożenie dla bezpieczeństwa.
Michał Chmielarz12 godz. temu
Qwen3.8-LiveTranslate: Alibaba prezentuje model do tłumaczeń symultanicznych z opóźnieniem 2,3 sekundy
Zespół Qwen firmy Alibaba wprowadził na rynek Qwen3.8-LiveTranslate, innowacyjny model do tłumaczeń symultanicznych w czasie rzeczywistym, który znacząco redukuje opóźnienia i oferuje zaawansowane funkcje.
Redakcja Aigest13 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.