Aigest.
Newsy

Kyutai prezentuje Voice of Reason: Model AI rozwiązujący zadania matematyczne mówione z użyciem uczenia ze wzmocnieniem

Firma Kyutai wprowadziła Voice of Reason, dwa otwarte modele zamiany mowy na mowę, które znacząco poprawiają dokładność rozwiązywania mówionych zadań matematycznych, wykorzystując uczenie ze wzmocnieniem.

RA

Udostępnij
Kyutai prezentuje Voice of Reason: Model AI rozwiązujący zadania matematyczne mówione z użyciem uczenia ze wzmocnieniem
Ilustracja poglądowa

Firma Kyutai ogłosiła premierę Voice of Reason, dwóch innowacyjnych modeli typu „mowa na mowę” (speech-to-speech), które zostały zaprojektowane do rozwiązywania mówionych zadań matematycznych. Modele te, oparte na architekturze GLM-4-Voice-9B, wyróżniają się tym, że nie wymagają etapu transkrypcji ani użycia tekstowego dużego modelu językowego (LLM) w procesie przetwarzania.

Przełom w rozwiązywaniu mówionych zadań matematycznych

Kluczowym osiągnięciem Voice of Reason jest znaczący wzrost dokładności w rozwiązywaniu zadań z zestawu danych GSM8K, które są prezentowane w formie mówionej. Dzięki zastosowaniu nadzorowanego dostrajania (supervised fine-tuning) oraz uczenia ze wzmocnieniem (reinforcement learning), dokładność modeli wzrosła z 27,3% do 77,1%. Jest to istotna poprawa, demonstrująca potencjał AI w interakcjach głosowych bez pośrednictwa tekstu.

Architektura i dostępność

Modele Voice of Reason zostały zbudowane na bazie GLM-4-Voice-9B, co wskazuje na ich zaawansowaną architekturę. Co ważne, Kyutai udostępniło oba punkty kontrolne (checkpoints) modeli jako otwarte oprogramowanie (open-weight) na platformie Hugging Face. Dzięki temu deweloperzy i badacze mogą swobodnie korzystać z tych rozwiązań, modyfikować je i rozwijać. Modele zostały zoptymalizowane pod kątem wydajności, co pozwala na ich uruchomienie na pojedynczej karcie graficznej H100.

Znaczenie dla przyszłości interfejsów głosowych

Brak konieczności transkrypcji mowy na tekst, a następnie przetwarzania go przez tradycyjny LLM, upraszcza architekturę i potencjalnie przyspiesza działanie systemów opartych na mowie. Voice of Reason stanowi ważny krok w kierunku bardziej naturalnych i bezpośrednich interfejsów głosowych, które mogą znaleźć zastosowanie w edukacji, asystentach osobistych czy systemach wsparcia, gdzie szybkie i dokładne przetwarzanie mówionych informacji jest kluczowe. Rozwój takich modeli otwiera nowe możliwości dla interakcji człowieka z maszyną, eliminując bariery językowe i technologiczne.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Microsoft rozbił platformę EvilTokens, która z pomocą AI przejęła 12 000 kont
OpenAI wzywa do międzynarodowych standardów dla samodoskonalącej się sztucznej inteligencji
NVIDIA prezentuje SoL-Pi: pętle auto-badawcze redukujące ruch tokenów agenta kodującego nawet o 49%
Brytyjski Instytut Bezpieczeństwa AI i EvalEval wspierają odtwarzalność wyników benchmarków
Panel ONZ ostrzega: Nie ma pewności, że ludzie utrzymają kontrolę nad agentami AI
Unity wprowadza oficjalne wtyczki dla Claude Code i OpenAI Codex, by zapobiec używaniu nieaktualnych poradników

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.