Aigest.
Narzędzia AI

Gradium AI wprowadza nowy model TTS z rekordową skutecznością w trudnych przypadkach

Firma Gradium AI ogłosiła wprowadzenie nowego domyślnego modelu Text-to-Speech (TTS), który osiąga 81% skuteczności w trudnych scenariuszach, wyprzedzając konkurencję.

RA

Udostępnij
Gradium AI wprowadza nowy model TTS z rekordową skutecznością w trudnych przypadkach
Fot. MarkTechPost

Firma Gradium AI ogłosiła wprowadzenie nowego, domyślnego modelu Text-to-Speech (TTS), który został zintegrowany z jej API oraz platformą Studio. Nowa technologia, uruchomiona 31 sierpnia 2026 roku, wyróżnia się 81-procentową skutecznością w przetwarzaniu mowy w tzw. „trudnych przypadkach”, co zostało ocenione przez ludzi. Wynik ten plasuje Gradium AI przed konkurencją, taką jak Cartesia Sonic 3.6 (75,1%) oraz ElevenLabs v3 Conversational (65,4%). Dodatkowo, model osiąga czas do pierwszego dźwięku wynoszący zaledwie 216 ms (P50) na platformie Coval, co oznacza przyspieszenie o 170 ms w porównaniu do poprzedniej wersji.

Metodologia testowania i wyniki

Gradium AI opracowało 500-zdaniowy zestaw ewaluacyjny, który został udostępniony publicznie na platformie Hugging Face na licencji CC BY 4.0. Zestaw ten obejmuje 100 pozycji dla 10 kryteriów w pięciu językach: angielskim (EN), niemieckim (DE), francuskim (FR), hiszpańskim (ES) i portugalskim (PT). Siedem kryteriów atomowych dotyczyło: pisowni, akronimów, tokenów alfanumerycznych, dat, liczb regularnych, dużych i zmiennoprzecinkowych oraz adresów e-mail. Trzy kryteria złożone (Zamówienia, Zgłoszenia IT, Roszczenia) łączyły kilka z nich, tworząc realistyczne scenariusze interakcji z agentem.

Ocena była przeprowadzana przez niezależnych native speakerów i charakteryzowała się dużą rygorystycznością. Zdanie było uznawane za poprawne tylko wtedy, gdy każdy element został wypowiedziany prawidłowo i kompletnie; pominięcie nawet jednej cyfry skutkowało odrzuceniem całego zdania. Nagrania były normalizowane pod względem głośności, a ich kolejność randomizowana. Osoby oceniające miały limit 40 porównań z wymuszoną przerwą.

Łączne wyniki, uśrednione dla dziesięciu kryteriów i pięciu języków z równą wagą, przedstawiają się następująco:

  • Gradium TTS: 81,0%
  • Cartesia Sonic 3.6: 75,1%
  • ElevenLabs v3 Conversational: 65,4%
  • Fish Audio S2.1 Pro: 49,5%
  • Inworld TTS 1.5 Max: 46,5%

Wszystkie modele zostały przetestowane w sierpniu 2026 roku z użyciem domyślnych ustawień.

Wydajność i szybkość działania

Na benchmarku TTS platformy Coval, Gradium AI odnotowało 216 ms P50 czasu do pierwszego dźwięku, co jest o 170 ms szybciej niż poprzedni model. Bardziej istotną miarą jest rozrzut wyników: 30 ms zakres międzykwartylowy p75-p25 dla 480 uruchomień, co jest najmniejszym rozrzutem spośród pięciu testowanych modeli. Dla porównania, Cartesia Sonic 3.6 osiągnęła medianę 454 ms z rozrzutem 165 ms, co stanowi 36% jej własnej mediany.

Chociaż Gradium AI nie jest najszybszym modelem na rynku (Inworld TTS 2 osiąga 166 ms, Fish Audio S2.1 Pro 291 ms, a ElevenLabs v3 Conversational 329 ms), firma podkreśla swoją pozycję jako lidera w połączeniu najniższego wskaźnika błędów w trudnych przypadkach z czasem do pierwszego dźwięku poniżej 250 ms i minimalną wariancją.

Dostępność i wsparcie dla użytkowników

Obecni użytkownicy Gradium AI nie muszą podejmować żadnych działań – nowy model został automatycznie wdrożony jako domyślny. Istniejące głosy, w tym niestandardowe klony, nadal działają bez zmian. Nowe zespoły mogą zainstalować Python SDK, wskazać na punkt końcowy WebSocket TTS i ponownie użyć istniejących identyfikatorów głosowych. Gradium AI oferuje 1 milion kredytów za zgłaszanie kompletnych raportów o błędach w trudnych przypadkach na swoim kanale Discord.

Wprowadzenie nowego modelu TTS przez Gradium AI stanowi znaczący krok naprzód w dziedzinie generowania mowy, szczególnie w kontekście zastosowań wymagających wysokiej precyzji, takich jak obsługa klienta czy systemy informacyjne. Połączenie wysokiej dokładności w trudnych scenariuszach z niskim opóźnieniem i minimalną wariancją może przyczynić się do poprawy jakości interakcji głosowych i zwiększenia satysfakcji użytkowników końcowych. Udostępnienie zestawu testowego na zasadach open source dodatkowo wspiera rozwój i transparentność w branży AI głosowej.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
Meta Superintelligence Labs wprowadza Muse Voice Transcribe – jeden model dla transkrypcji, diaryzacji i detekcji końca
BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność
Szef Google DeepMind: Liderowanie w rozwoju AI to nasz priorytet

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.