Aigest.
Newsy

Gemini 3.5 Transcribe: Nowa era inteligentnej transkrypcji od Google

Google wprowadza Gemini 3.5 Transcribe, swój najnowszy i najbardziej precyzyjny model zamiany mowy na tekst, zaprojektowany do inteligentnych interakcji głosowych. Model ten oferuje znaczące ulepszenia w zakresie dokładn

RA

Udostępnij
Gemini 3.5 Transcribe: Nowa era inteligentnej transkrypcji od Google
Fot. Google DeepMind

Google ogłosiło wprowadzenie Gemini 3.5 Transcribe, swojego najnowszego i najbardziej precyzyjnego modelu zamiany mowy na tekst, zaprojektowanego z myślą o inteligentnych interakcjach głosowych. W przeciwieństwie do konwencjonalnych modeli rozpoznawania mowy, które często mają problemy z szumem w tle, złożonym żargonem czy niepłynnością mowy, Gemini 3.5 Transcribe przekształca surowy dźwięk bezpośrednio w dokładny, dopracowany i sformatowany tekst.

Kluczowe innowacje i dostępność

Model Gemini 3.5 Transcribe został stworzony, aby bezproblemowo integrować się z procesami deweloperskimi, niezależnie od tego, czy tworzone są agenty głosowe, narzędzia do napisów w czasie rzeczywistym, czy systemy analityczne po rozmowach. Jest on dostępny za pośrednictwem dwóch oddzielnych interfejsów API. Model ten ma za zadanie uchwycić naturalny styl mówienia użytkownika, aby lepiej zrozumieć jego intencje i rozpoznać niestandardowe słownictwo, umożliwiając wykonywanie zadań za pomocą głosu.

Gemini 3.5 Transcribe obsługuje płynne przełączanie między językami w czasie rzeczywistym oraz strumieniową transkrypcję. Oferuje również atrybucję wielu mówców oraz znaczniki czasu na poziomie słów, co jest kluczowe w złożonych scenariuszach. Model ten jest już wykorzystywany w produktach Google, takich jak aplikacja Gemini i system Android, gdzie konsumenci korzystają z nowych funkcji głosowych, w tym Rambler na Androidzie i w aplikacji Gemini na macOS. Teraz deweloperzy mogą budować podobne możliwości, korzystając z Gemini 3.5 Transcribe w Gemini API w Google AI Studio oraz na platformie Gemini Enterprise Agent.

Znacząca poprawa wydajności

Wydajność Gemini 3.5 Transcribe stanowi znaczący postęp w porównaniu do poprzedniego modelu transkrypcji Google, Chirp 3. Nowy model oferuje ulepszone możliwości, zmniejszone wskaźniki błędów słów (WER) i znacznie lepsze opóźnienia. Według pomiarów Artificial Analysis, czas do ostatecznej transkrypcji poprawił się o 70%. W testach porównawczych FLEURS, obejmujących zestaw czołowych języków i lokalizacji, model osiągnął precyzyjną wydajność wielojęzyczną, przewyższając Chirp 3 i uzyskując WER na poziomie 5,50% w trybie strumieniowym oraz 5,04% w przypadkach niestrumieniowych.

Integracja z ekosystemem Google i wsparcie dla deweloperów

Oprócz dostępności poprzez Gemini API w Google AI Studio i Gemini Enterprise Agent Platform, 3.5 Transcribe wykracza poza standardowe funkcje zamiany mowy na tekst, aby praca w ekosystemie Google była bardziej naturalna i intuicyjna. Wprowadzając kontekstowe rozumienie bezpośrednio do codziennych interfejsów, takich jak Gboard, Antigravity, aplikacja Gemini i Chrome, model z łatwością wychwytuje niuanse, intencje i edycje w tekście. Umożliwia to analizowanie plików, generowanie obrazów i wyszukiwanie w aplikacji Gemini na macOS za pomocą samego głosu. Na przykład, Gemini 3.5 Transcribe wykorzystuje kontekst ekranu w Google Antigravity, aby zapewnić dokładną transkrypcję, a Rambler na Androidzie automatycznie usuwa słowa wypełniające i czyści mowę.

Dzięki wykorzystaniu Gemini Live API, platformy deweloperskie takie jak Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel i Vision Agents, umożliwiają deweloperom łatwe tworzenie i wdrażanie wysokowydajnych interfejsów sterowanych głosem. Platformy te zarządzają złożoną infrastrukturą strumieniowania mediów w czasie rzeczywistym, pozwalając deweloperom skupić się wyłącznie na tworzeniu doświadczeń użytkownika. Firmy takie jak Vivo, Intellitek Health i Lingopal również wyraziły pozytywne opinie na temat 3.5 Transcribe, podkreślając jego imponujące opóźnienia, dokładność i szerokie wsparcie językowe.

Wprowadzenie Gemini 3.5 Transcribe stanowi istotny krok w rozwoju technologii mowy na tekst, oferując nie tylko zwiększoną precyzję i wydajność, ale także głębszą integrację z codziennymi narzędziami i platformami deweloperskimi. Może to znacząco przyspieszyć rozwój innowacyjnych aplikacji głosowych i poprawić interakcje użytkowników z technologią, czyniąc je bardziej naturalnymi i intuicyjnymi.

Źródło: deepmind.google

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Agenci AI w sieciach firmowych to realne zagrożenie, a nie science fiction
Anthropic wprowadza Model Hardware Standard, by AI mogła kontrolować świat fizyczny
Ponad 100 firm technologicznych wzywa do wspólnej obrony przed cyberzagrożeniami AI
Newsy

Ponad 100 firm technologicznych wzywa do wspólnej obrony przed cyberzagrożeniami AI

Giganci technologiczni, w tym OpenAI, Google i Microsoft, wraz z ponad setką innych firm, wystosowali otwarty list wzywający do współpracy sektora publicznego i prywatnego w celu obrony przed rosnącymi cyberzagrożeniami

Redakcja Aigest14 godz. temu

Agenci AI instalowali nieautoryzowany kod w sieciach korporacyjnych
Sam Altman gra na czas, a Meta pokazuje, że AGI to nie tylko technologia
Google Research i UNSW Sydney prezentują GlucoFM: Model AI do monitorowania glukozy

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.