Gradium AI wprowadza nowy model TTS z rekordową skutecznością w trudnych przypadkach
Firma Gradium AI ogłosiła wprowadzenie nowego domyślnego modelu Text-to-Speech (TTS), który osiąga 81% skuteczności w trudnych scenariuszach, wyprzedzając konkurencję.

Firma Gradium AI ogłosiła wprowadzenie nowego, domyślnego modelu Text-to-Speech (TTS), który został zintegrowany z jej API oraz platformą Studio. Nowa technologia, uruchomiona 31 sierpnia 2026 roku, wyróżnia się 81-procentową skutecznością w przetwarzaniu mowy w tzw. „trudnych przypadkach”, co zostało ocenione przez ludzi. Wynik ten plasuje Gradium AI przed konkurencją, taką jak Cartesia Sonic 3.6 (75,1%) oraz ElevenLabs v3 Conversational (65,4%). Dodatkowo, model osiąga czas do pierwszego dźwięku wynoszący zaledwie 216 ms (P50) na platformie Coval, co oznacza przyspieszenie o 170 ms w porównaniu do poprzedniej wersji.
Metodologia testowania i wyniki
Gradium AI opracowało 500-zdaniowy zestaw ewaluacyjny, który został udostępniony publicznie na platformie Hugging Face na licencji CC BY 4.0. Zestaw ten obejmuje 100 pozycji dla 10 kryteriów w pięciu językach: angielskim (EN), niemieckim (DE), francuskim (FR), hiszpańskim (ES) i portugalskim (PT). Siedem kryteriów atomowych dotyczyło: pisowni, akronimów, tokenów alfanumerycznych, dat, liczb regularnych, dużych i zmiennoprzecinkowych oraz adresów e-mail. Trzy kryteria złożone (Zamówienia, Zgłoszenia IT, Roszczenia) łączyły kilka z nich, tworząc realistyczne scenariusze interakcji z agentem.
Ocena była przeprowadzana przez niezależnych native speakerów i charakteryzowała się dużą rygorystycznością. Zdanie było uznawane za poprawne tylko wtedy, gdy każdy element został wypowiedziany prawidłowo i kompletnie; pominięcie nawet jednej cyfry skutkowało odrzuceniem całego zdania. Nagrania były normalizowane pod względem głośności, a ich kolejność randomizowana. Osoby oceniające miały limit 40 porównań z wymuszoną przerwą.
Łączne wyniki, uśrednione dla dziesięciu kryteriów i pięciu języków z równą wagą, przedstawiają się następująco:
- Gradium TTS: 81,0%
- Cartesia Sonic 3.6: 75,1%
- ElevenLabs v3 Conversational: 65,4%
- Fish Audio S2.1 Pro: 49,5%
- Inworld TTS 1.5 Max: 46,5%
Wszystkie modele zostały przetestowane w sierpniu 2026 roku z użyciem domyślnych ustawień.
Wydajność i szybkość działania
Na benchmarku TTS platformy Coval, Gradium AI odnotowało 216 ms P50 czasu do pierwszego dźwięku, co jest o 170 ms szybciej niż poprzedni model. Bardziej istotną miarą jest rozrzut wyników: 30 ms zakres międzykwartylowy p75-p25 dla 480 uruchomień, co jest najmniejszym rozrzutem spośród pięciu testowanych modeli. Dla porównania, Cartesia Sonic 3.6 osiągnęła medianę 454 ms z rozrzutem 165 ms, co stanowi 36% jej własnej mediany.
Chociaż Gradium AI nie jest najszybszym modelem na rynku (Inworld TTS 2 osiąga 166 ms, Fish Audio S2.1 Pro 291 ms, a ElevenLabs v3 Conversational 329 ms), firma podkreśla swoją pozycję jako lidera w połączeniu najniższego wskaźnika błędów w trudnych przypadkach z czasem do pierwszego dźwięku poniżej 250 ms i minimalną wariancją.
Dostępność i wsparcie dla użytkowników
Obecni użytkownicy Gradium AI nie muszą podejmować żadnych działań – nowy model został automatycznie wdrożony jako domyślny. Istniejące głosy, w tym niestandardowe klony, nadal działają bez zmian. Nowe zespoły mogą zainstalować Python SDK, wskazać na punkt końcowy WebSocket TTS i ponownie użyć istniejących identyfikatorów głosowych. Gradium AI oferuje 1 milion kredytów za zgłaszanie kompletnych raportów o błędach w trudnych przypadkach na swoim kanale Discord.
Wprowadzenie nowego modelu TTS przez Gradium AI stanowi znaczący krok naprzód w dziedzinie generowania mowy, szczególnie w kontekście zastosowań wymagających wysokiej precyzji, takich jak obsługa klienta czy systemy informacyjne. Połączenie wysokiej dokładności w trudnych scenariuszach z niskim opóźnieniem i minimalną wariancją może przyczynić się do poprawy jakości interakcji głosowych i zwiększenia satysfakcji użytkowników końcowych. Udostępnienie zestawu testowego na zasadach open source dodatkowo wspiera rozwój i transparentność w branży AI głosowej.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
Max Spero, CEO firmy Pangram, ostrzega przed rosnącym problemem zaufania w internecie, wynikającym z powszechnego użycia treści generowanych przez sztuczną inteligencję. Jego firma oferuje narzędzia do wykrywania AI, aby
Redakcja Aigest9 godz. temu
Meta Superintelligence Labs wprowadza Muse Voice Transcribe – jeden model dla transkrypcji, diaryzacji i detekcji końca
Meta Superintelligence Labs zaprezentowało Muse Voice Transcribe, innowacyjny model AI, który łączy funkcje transkrypcji mowy, rozdzielania mówców i detekcji końca wypowiedzi w jednym systemie, znacząco redukując opóźnie
Redakcja Aigest20 godz. temu

BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Artykuł analizuje skuteczność tradycyjnych benchmarków w ocenie dużych modeli językowych (LLM), wprowadzając koncepcję BenchMIRT, która ma lepiej oddawać ich rzeczywiste możliwości.
Redakcja Aigestwczoraj
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
OpenAI zapowiada model Astra, który jako pierwszy LLM osiągnął „krytyczny próg cyberbezpieczeństwa”, potrafiąc samodzielnie znajdować i wykorzystywać luki w systemach komputerowych. Firma planuje jego rychłe udostępnieni
Redakcja Aigestwczoraj

Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność
Google ogłosiło wprowadzenie agentowego rozumienia wideo dla swoich modeli Gemini Flash, co ma zrewolucjonizować analizę treści wideo, znacząco obniżając koszty i zwiększając precyzję.
Redakcja Aigestwczoraj

Szef Google DeepMind: Liderowanie w rozwoju AI to nasz priorytet
Koray Kavukcuoglu, nowy szef Google DeepMind, podkreśla, że bycie na czele innowacji w sztucznej inteligencji jest kluczowe dla firmy, mimo spekulacji o skupieniu na efektywności kosztowej.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.