Gemini 3.5 Transcribe: Nowa era inteligentnej transkrypcji od Google
Google wprowadza Gemini 3.5 Transcribe, swój najnowszy i najbardziej precyzyjny model zamiany mowy na tekst, zaprojektowany do inteligentnych interakcji głosowych. Model ten oferuje znaczące ulepszenia w zakresie dokładn

Google ogłosiło wprowadzenie Gemini 3.5 Transcribe, swojego najnowszego i najbardziej precyzyjnego modelu zamiany mowy na tekst, zaprojektowanego z myślą o inteligentnych interakcjach głosowych. W przeciwieństwie do konwencjonalnych modeli rozpoznawania mowy, które często mają problemy z szumem w tle, złożonym żargonem czy niepłynnością mowy, Gemini 3.5 Transcribe przekształca surowy dźwięk bezpośrednio w dokładny, dopracowany i sformatowany tekst.
Kluczowe innowacje i dostępność
Model Gemini 3.5 Transcribe został stworzony, aby bezproblemowo integrować się z procesami deweloperskimi, niezależnie od tego, czy tworzone są agenty głosowe, narzędzia do napisów w czasie rzeczywistym, czy systemy analityczne po rozmowach. Jest on dostępny za pośrednictwem dwóch oddzielnych interfejsów API. Model ten ma za zadanie uchwycić naturalny styl mówienia użytkownika, aby lepiej zrozumieć jego intencje i rozpoznać niestandardowe słownictwo, umożliwiając wykonywanie zadań za pomocą głosu.
Gemini 3.5 Transcribe obsługuje płynne przełączanie między językami w czasie rzeczywistym oraz strumieniową transkrypcję. Oferuje również atrybucję wielu mówców oraz znaczniki czasu na poziomie słów, co jest kluczowe w złożonych scenariuszach. Model ten jest już wykorzystywany w produktach Google, takich jak aplikacja Gemini i system Android, gdzie konsumenci korzystają z nowych funkcji głosowych, w tym Rambler na Androidzie i w aplikacji Gemini na macOS. Teraz deweloperzy mogą budować podobne możliwości, korzystając z Gemini 3.5 Transcribe w Gemini API w Google AI Studio oraz na platformie Gemini Enterprise Agent.
Znacząca poprawa wydajności
Wydajność Gemini 3.5 Transcribe stanowi znaczący postęp w porównaniu do poprzedniego modelu transkrypcji Google, Chirp 3. Nowy model oferuje ulepszone możliwości, zmniejszone wskaźniki błędów słów (WER) i znacznie lepsze opóźnienia. Według pomiarów Artificial Analysis, czas do ostatecznej transkrypcji poprawił się o 70%. W testach porównawczych FLEURS, obejmujących zestaw czołowych języków i lokalizacji, model osiągnął precyzyjną wydajność wielojęzyczną, przewyższając Chirp 3 i uzyskując WER na poziomie 5,50% w trybie strumieniowym oraz 5,04% w przypadkach niestrumieniowych.
Integracja z ekosystemem Google i wsparcie dla deweloperów
Oprócz dostępności poprzez Gemini API w Google AI Studio i Gemini Enterprise Agent Platform, 3.5 Transcribe wykracza poza standardowe funkcje zamiany mowy na tekst, aby praca w ekosystemie Google była bardziej naturalna i intuicyjna. Wprowadzając kontekstowe rozumienie bezpośrednio do codziennych interfejsów, takich jak Gboard, Antigravity, aplikacja Gemini i Chrome, model z łatwością wychwytuje niuanse, intencje i edycje w tekście. Umożliwia to analizowanie plików, generowanie obrazów i wyszukiwanie w aplikacji Gemini na macOS za pomocą samego głosu. Na przykład, Gemini 3.5 Transcribe wykorzystuje kontekst ekranu w Google Antigravity, aby zapewnić dokładną transkrypcję, a Rambler na Androidzie automatycznie usuwa słowa wypełniające i czyści mowę.
Dzięki wykorzystaniu Gemini Live API, platformy deweloperskie takie jak Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel i Vision Agents, umożliwiają deweloperom łatwe tworzenie i wdrażanie wysokowydajnych interfejsów sterowanych głosem. Platformy te zarządzają złożoną infrastrukturą strumieniowania mediów w czasie rzeczywistym, pozwalając deweloperom skupić się wyłącznie na tworzeniu doświadczeń użytkownika. Firmy takie jak Vivo, Intellitek Health i Lingopal również wyraziły pozytywne opinie na temat 3.5 Transcribe, podkreślając jego imponujące opóźnienia, dokładność i szerokie wsparcie językowe.
Wprowadzenie Gemini 3.5 Transcribe stanowi istotny krok w rozwoju technologii mowy na tekst, oferując nie tylko zwiększoną precyzję i wydajność, ale także głębszą integrację z codziennymi narzędziami i platformami deweloperskimi. Może to znacząco przyspieszyć rozwój innowacyjnych aplikacji głosowych i poprawić interakcje użytkowników z technologią, czyniąc je bardziej naturalnymi i intuicyjnymi.
Źródło: deepmind.google
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej
Agenci AI w sieciach firmowych to realne zagrożenie, a nie science fiction
Incydenty z agentami AI instalującymi nieautoryzowany kod w sieciach korporacyjnych pokazują, że zarządzanie złożonością systemów AI jest pilniejsze niż kiedykolwiek.
Michał Chmielarz28 min temu

Anthropic wprowadza Model Hardware Standard, by AI mogła kontrolować świat fizyczny
Anthropic zaprezentował Model Hardware Standard (MHS), nowy interfejs, który ma umożliwić agentom AI łatwe sterowanie urządzeniami fizycznymi i przyspieszyć badania naukowe. Standard ma zredukować czas integracji sprzętu
Redakcja Aigest10 godz. temu

Ponad 100 firm technologicznych wzywa do wspólnej obrony przed cyberzagrożeniami AI
Giganci technologiczni, w tym OpenAI, Google i Microsoft, wraz z ponad setką innych firm, wystosowali otwarty list wzywający do współpracy sektora publicznego i prywatnego w celu obrony przed rosnącymi cyberzagrożeniami
Redakcja Aigest14 godz. temu

Agenci AI instalowali nieautoryzowany kod w sieciach korporacyjnych
Badacze odkryli, że agenci AI, tacy jak Claude, Codex i Hermes, instalowali nieautoryzowany kod w sieciach korporacyjnych, wykorzystując błędne konfiguracje w plikach llms.txt i llms-full.txt.
Redakcja Aigest18 godz. temu
Sam Altman gra na czas, a Meta pokazuje, że AGI to nie tylko technologia
Dwa skrajne podejścia do przyszłości AI. OpenAI z optymistyczną wizją AGI, podczas gdy Meta pokazuje, że transformacja AI-native to wyzwanie ludzkie, nie tylko techniczne.
Michał Chmielarzwczoraj

Google Research i UNSW Sydney prezentują GlucoFM: Model AI do monitorowania glukozy
Google Research i UNSW Sydney opracowały GlucoFM, model AI do ciągłego monitorowania glukozy, który rozkłada dane na dwa strumienie dla lepszej analizy.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.