Kyutai prezentuje Voice of Reason: Model AI rozwiązujący zadania matematyczne mówione z użyciem uczenia ze wzmocnieniem
Firma Kyutai wprowadziła Voice of Reason, dwa otwarte modele zamiany mowy na mowę, które znacząco poprawiają dokładność rozwiązywania mówionych zadań matematycznych, wykorzystując uczenie ze wzmocnieniem.
Firma Kyutai ogłosiła premierę Voice of Reason, dwóch innowacyjnych modeli typu „mowa na mowę” (speech-to-speech), które zostały zaprojektowane do rozwiązywania mówionych zadań matematycznych. Modele te, oparte na architekturze GLM-4-Voice-9B, wyróżniają się tym, że nie wymagają etapu transkrypcji ani użycia tekstowego dużego modelu językowego (LLM) w procesie przetwarzania.
Przełom w rozwiązywaniu mówionych zadań matematycznych
Kluczowym osiągnięciem Voice of Reason jest znaczący wzrost dokładności w rozwiązywaniu zadań z zestawu danych GSM8K, które są prezentowane w formie mówionej. Dzięki zastosowaniu nadzorowanego dostrajania (supervised fine-tuning) oraz uczenia ze wzmocnieniem (reinforcement learning), dokładność modeli wzrosła z 27,3% do 77,1%. Jest to istotna poprawa, demonstrująca potencjał AI w interakcjach głosowych bez pośrednictwa tekstu.
Architektura i dostępność
Modele Voice of Reason zostały zbudowane na bazie GLM-4-Voice-9B, co wskazuje na ich zaawansowaną architekturę. Co ważne, Kyutai udostępniło oba punkty kontrolne (checkpoints) modeli jako otwarte oprogramowanie (open-weight) na platformie Hugging Face. Dzięki temu deweloperzy i badacze mogą swobodnie korzystać z tych rozwiązań, modyfikować je i rozwijać. Modele zostały zoptymalizowane pod kątem wydajności, co pozwala na ich uruchomienie na pojedynczej karcie graficznej H100.
Znaczenie dla przyszłości interfejsów głosowych
Brak konieczności transkrypcji mowy na tekst, a następnie przetwarzania go przez tradycyjny LLM, upraszcza architekturę i potencjalnie przyspiesza działanie systemów opartych na mowie. Voice of Reason stanowi ważny krok w kierunku bardziej naturalnych i bezpośrednich interfejsów głosowych, które mogą znaleźć zastosowanie w edukacji, asystentach osobistych czy systemach wsparcia, gdzie szybkie i dokładne przetwarzanie mówionych informacji jest kluczowe. Rozwój takich modeli otwiera nowe możliwości dla interakcji człowieka z maszyną, eliminując bariery językowe i technologiczne.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Microsoft rozbił platformę EvilTokens, która z pomocą AI przejęła 12 000 kont
Microsoft ogłosił rozbicie platformy EvilTokens, która wykorzystywała sztuczną inteligencję do masowego przejmowania kont Microsoft, kompromitując 12 000 kont należących do 10 000 organizacji.
Redakcja Aigest21 godz. temu

OpenAI wzywa do międzynarodowych standardów dla samodoskonalącej się sztucznej inteligencji
OpenAI apeluje o globalne regulacje dotyczące zaawansowanych systemów AI, zwłaszcza tych zdolnych do samodoskonalenia. Firma podkreśla potrzebę bezpieczeństwa, zanim takie technologie staną się powszechne.
Redakcja Aigestwczoraj
NVIDIA prezentuje SoL-Pi: pętle auto-badawcze redukujące ruch tokenów agenta kodującego nawet o 49%
Badacze z NVIDII wprowadzili SoL-Pi, zestaw mechanizmów dla agenta kodującego Pi, które znacząco obniżają zużycie tokenów i koszty API, zachowując wysoką wydajność.
Redakcja Aigestwczoraj
Brytyjski Instytut Bezpieczeństwa AI i EvalEval wspierają odtwarzalność wyników benchmarków
Brytyjski Instytut Bezpieczeństwa AI (AISI) wykorzystuje infrastrukturę EvalEval do publicznego udostępniania wyników ewaluacji, co ma na celu zwiększenie odtwarzalności i weryfikowalności badań nad sztuczną inteligencją
Redakcja Aigestwczoraj

Panel ONZ ostrzega: Nie ma pewności, że ludzie utrzymają kontrolę nad agentami AI
Pierwszy raport panelu naukowego ONZ ds. AI alarmuje, że kontrola nad autonomicznymi agentami sztucznej inteligencji nie jest gwarantowana, wskazując na rosnące ryzyko związane z ich szkoleniem i zachowaniem.
Redakcja Aigestwczoraj
Unity wprowadza oficjalne wtyczki dla Claude Code i OpenAI Codex, by zapobiec używaniu nieaktualnych poradników
Unity Technologies, twórca popularnego silnika gier, udostępniło oficjalne wtyczki dla Claude Code i OpenAI Codex. Mają one zapewnić agentom AI dostęp do aktualnych informacji i umiejętności, eliminując problem korzystan
Redakcja Aigest4 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.