Google wprowadza Gemini 3.8 Flash TTS i Flash-Lite TTS – nowe modele zamiany tekstu na mowę z zaawansowaną kontrolą głos
Google zaprezentowało Gemini 3.8 Flash TTS i Flash-Lite TTS, nowe modele zamiany tekstu na mowę, które oferują bezprecedensową kontrolę nad generowaniem głosu, w tym akcentem i tonem emocjonalnym. Modele te są już dostęp

Google zaprezentowało Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS, dwa nowe modele zamiany tekstu na mowę, które mają zrewolucjonizować generowanie dźwięku. Modele te, określane jako najbardziej ekspresyjne w historii firmy, pozwalają na tworzenie niestandardowych głosów postaci i reżyserowanie dialogów scenicznych z niezwykłą precyzją, w tym kontrolą nad akcentem i tonem emocjonalnym. Są one dostępne w Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook oraz Google Vids.
Dynamiczne studio kreatywne dla głosu
Nowe modele Gemini przekształcają generowanie głosu ze statycznych ustawień wstępnych w dynamiczne studio kreatywne. Umożliwiają one twórcom, deweloperom i przedsiębiorstwom tworzenie bogatszych i bardziej ekspresyjnych doświadczeń audio. Modele te uzupełniają rosnącą rodzinę Gemini Audio, do której należą już 3.5 Live Translate, 3.5 Transcribe, 3.8 Live i 3.8 Live Extended Thinking.
Gemini 3.8 Flash TTS oferuje możliwość skalowania od 30 oryginalnych głosów do nieskończonej biblioteki, co pozwala na tworzenie całkowicie oryginalnych głosów postaci lub spójnych głosów ambasadorów marki. Dzięki temu deweloperzy i przedsiębiorstwa mogą łatwo budować niestandardowe doświadczenia audio, wykorzystując ekspresyjne i naturalnie brzmiące głosy. Modele te zapewniają precyzyjną kontrolę nad sposobem wypowiadania każdej linii dialogowej, co pozwala na tworzenie angażujących i immersyjnych doświadczeń audio, w tym naturalnych konwersacji dla interaktywnych agentów głosowych.
Lider w personalizacji głosu i bezpieczeństwie
Gemini 3.8 Flash TTS osiągnął czołowe pozycje w branżowych benchmarkach. Zajął pierwsze miejsce w rankingu Hume AI’s Voice Design Benchmark z wynikiem 71.4, a także prowadzi w modelowaniu akcentów (60.8). Oba modele, Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS, zajęły odpowiednio pierwsze i drugie miejsce w Hume AI’s Overall Quality Index, co świadczy o ich niezawodności i ekspresyjności. W porównaniu do Gemini 3.1 Flash TTS, nowe wersje wykazują znaczące ulepszenia w szerokim zakresie zastosowań, takich jak długie treści i kontrola scenariuszy z dwoma mówcami.
W ślepych testach preferencji ludzkich przeprowadzonych na Voice Arena, Gemini 3.8 Flash i Flash-Lite TTS zajęły czołowe pozycje wśród konkurentów w kluczowych językach globalnych, w tym japońskim, brazylijskim portugalskim, wietnamskim, współczesnym standardowym arabskim (MSA), meksykańskim hiszpańskim i hindi. Dzięki wsparciu dla ponad 100 języków, modele te umożliwiają tworzenie wysokiej jakości, wielojęzycznych doświadczeń głosowych na całym świecie.
Google podkreśla również zaangażowanie w bezpieczeństwo i odpowiedzialne wykorzystanie technologii. System replikacji głosu wymaga weryfikacji zgody – użytkownicy muszą dostarczyć nagranie werbalnej zgody od właściciela głosu, które pasuje do referencyjnego mówcy. Ponadto, każdy klip audio generowany przez modele Gemini Audio jest znakowany niewidzialnym znakiem wodnym SynthID, co pozwala na wykrywanie mowy generowanej przez AI i pomaga zapobiegać dezinformacji.
Dostępność i partnerstwa
Od dziś deweloperzy mogą korzystać z nowych możliwości generowania mowy w Google AI Studio. Platforma ta, zaprojektowana jako przestrzeń do projektowania głosu, pozwala na tworzenie zupełnie nowych tożsamości wokalnych od podstaw lub replikowanie własnego głosu, a następnie przenoszenie ich do edytora scenariuszy z dwoma mówcami, aby reżyserować dostarczanie linii dialogowych. Dzięki Gemini API, platformy deweloperskie takie jak Agora, LiveKit, Pipecat i Vercel mogą łatwo budować i wdrażać wysokowydajne doświadczenia generowania mowy.
Google nawiązało współpracę z firmami takimi jak Figma, HeyGen, Linguana, Wondercraft, 99.co i Ollang, które integrują najnowsze modele TTS w celu przyspieszenia globalnego dubbingu, lokalizacji mediów z niuansowanymi akcentami regionalnymi oraz zasilania konwersacyjnych agentów głosowych na dużą skalę. Wprowadzenie Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS rozpoczyna się już dziś.
Wprowadzenie tak zaawansowanych narzędzi do generowania głosu otwiera nowe możliwości dla twórców treści, deweloperów gier, producentów audiobooków i firm poszukujących innowacyjnych sposobów komunikacji. Precyzyjna kontrola nad niuansami głosu, połączona z solidnymi zabezpieczeniami, wskazuje na kierunek, w którym zmierza rozwój sztucznej inteligencji w dziedzinie audio – ku większej personalizacji, ekspresji i odpowiedzialności.
Źródło: deepmind.google
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej
Prywatna pamięć po stronie serwera dla bezpiecznej sztucznej inteligencji
Wprowadzono prywatną pamięć po stronie serwera w celu zwiększenia bezpieczeństwa obliczeń AI, szczególnie w kontekście osobistej sztucznej inteligencji.
Redakcja Aigest5 godz. temu

Koszty AI spadają, co otwiera nowe możliwości dla lokalnych wdrożeń
Obniżanie kosztów modeli AI, takich jak Claude Opus 5.5 czy rozwiązania NVIDIA SoL-Pi, zmienia reguły gry, przyspieszając demokratyzację sztucznej inteligencji i jej dostępność poza gigantami technologicznymi.
Michał Chmielarz13 godz. temu
Kyutai prezentuje Voice of Reason: Model AI rozwiązujący zadania matematyczne mówione z użyciem uczenia ze wzmocnieniem
Firma Kyutai wprowadziła Voice of Reason, dwa otwarte modele zamiany mowy na mowę, które znacząco poprawiają dokładność rozwiązywania mówionych zadań matematycznych, wykorzystując uczenie ze wzmocnieniem.
Redakcja Aigest15 godz. temu

Microsoft rozbił platformę EvilTokens, która z pomocą AI przejęła 12 000 kont
Microsoft ogłosił rozbicie platformy EvilTokens, która wykorzystywała sztuczną inteligencję do masowego przejmowania kont Microsoft, kompromitując 12 000 kont należących do 10 000 organizacji.
Redakcja Aigestwczoraj

Anthropic wprowadza Claude Opus 5.5: niższy koszt, lepsza wydajność i bardziej naturalny język
Anthropic zaprezentował Claude Opus 5.5, nowy model AI, który dorównuje wydajnością Fable 5.1, oferując jednocześnie znacznie niższe koszty operacyjne i bardziej naturalny styl komunikacji.
Redakcja Aigestwczoraj

OpenAI wzywa do międzynarodowych standardów dla samodoskonalącej się sztucznej inteligencji
OpenAI apeluje o globalne regulacje dotyczące zaawansowanych systemów AI, zwłaszcza tych zdolnych do samodoskonalenia. Firma podkreśla potrzebę bezpieczeństwa, zanim takie technologie staną się powszechne.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.