Aigest.
Newsy

Google wprowadza Gemini 3.5 Transcribe: szybsze i dokładniejsze przetwarzanie mowy na tekst

Google zaprezentowało Gemini 3.5 Transcribe, nowy model AI do konwersji mowy na tekst, który ma być szybszy i dokładniejszy od poprzednika, a także usuwać z wypowiedzi zbędne słowa i poprawiać błędy.

RA

Udostępnij
Google wprowadza Gemini 3.5 Transcribe: szybsze i dokładniejsze przetwarzanie mowy na tekst
Fot. Google

Google wprowadza na rynek Gemini 3.5 Transcribe, nowy model sztucznej inteligencji, który ma zrewolucjonizować wprowadzanie głosowe, oferując szybsze i dokładniejsze przetwarzanie mowy na tekst. Technologia ta, już obecna w funkcji „Rambler” klawiatury Gboard na telefonach Pixel 11, zostanie wkrótce zintegrowana z szerszym ekosystemem Google, w tym z przeglądarką Chrome.

Usprawnienia w szybkości i dokładności

Według Google, Gemini 3.5 Transcribe znacząco przewyższa swojego poprzednika, silnik Chirp 3, pod względem szybkości i dokładności. Nowy model AI ma być o około 70 procent szybszy w konwersji mowy na finalny tekst. Co więcej, wskaźnik błędów w mowie na żywo spadł do 5,5 procenta, co stanowi poprawę w stosunku do 7,32 procenta osiąganych przez Chirp 3. Choć różnica w dokładności nie jest drastyczna, każda redukcja błędów jest korzystna, biorąc pod uwagę frustrację związaną z poprawianiem literówek podczas wprowadzania głosowego.

Inteligentne przetwarzanie języka

Gemini 3.5 Transcribe nie tylko lepiej rozpoznaje wypowiadane słowa, ale także ma lepiej rozumieć intencje użytkownika. Model potrafi usuwać z wypowiedzi niepotrzebne wtrącenia, takie jak „yyy” czy „eee”, które często zakłócają płynność mowy. Dodatkowo, AI może edytować tekst na bieżąco, umożliwiając użytkownikowi wprowadzanie poprawek w trakcie mówienia. Model obsługuje również niestandardowe słownictwo, co pozwala na precyzyjne transkrybowanie specjalistycznego żargonu. Wszystkie te funkcje działają w 85 językach i obsługują do trzech mówców w przypadku nagrań audio.

Dostępność i przyszłe wdrożenia

Obecnie Gemini 3.5 Transcribe jest już dostępny w kilku miejscach. Funkcja Rambler w Gboard, bazująca na tym modelu, jest dostępna na telefonach Pixel 11. Google zapowiedziało, że Rambler zostanie rozszerzony na „więcej urządzeń Gemini Intelligence” jeszcze w tym roku. Użytkownicy aplikacji Gemini na macOS mogą korzystać z ulepszonego wprowadzania głosowego dzięki Gemini 3.5 Transcribe już od dziś.

Model jest również udostępniany deweloperom. Od dziś Antigravity będzie miało dostęp do nowego modelu, z pełnym dostępem do kontekstu ekranu i historii czatu (za zgodą użytkownika). AI Studio również integruje Gemini 3.5 Transcribe, umożliwiając deweloperom tworzenie aplikacji zoptymalizowanych pod kątem głosowego wprowadzania tekstu. Dostęp do modelu jest możliwy także poprzez Gemini API.

Google planuje wprowadzić funkcję transkrypcji AI do przeglądarki Chrome „wkrótce”. Po jej udostępnieniu, użytkownicy będą mogli wprowadzać tekst głosowo w dowolnym polu internetowym, co otworzy nowe możliwości, od pisania e-maili po interakcje z chatbotami AI.

Potencjalne wyzwania i korzyści

Choć Gemini 3.5 Transcribe oferuje znaczące usprawnienia, wiąże się z nim również pewne wyzwanie: poleganie na AI w dokładnym uchwyceniu sensu wypowiedzi. W przypadku krótkich fragmentów tekstu model wydaje się skuteczny w usuwaniu niespójności i potknięć językowych. Należy jednak pamiętać, że AI technicznie zmienia sformułowania, co może nie być odpowiednie we wszystkich sytuacjach, gdzie precyzyjne odwzorowanie oryginalnej wypowiedzi jest kluczowe. Niemniej jednak, szerokie wdrożenie tej technologii w ekosystemie Google i jej dostępność dla deweloperów z pewnością przyczynią się do dalszego rozwoju interfejsów głosowych, czyniąc je bardziej intuicyjnymi i efektywnymi dla szerokiego grona użytkowników.

Źródło: arstechnica.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Ograniczenie samoświadomości AI zmienia jej postrzeganie świata – badanie Google
Orkiestracja kluczem do sukcesu w obsłudze klienta z agentami AI
IBM udostępnia modele Granite 4.2 z funkcjami agentowymi oraz Granite Speech 5.0 Turbo CTC
IBM prezentuje Granite 4.2: Nowe modele językowe z zaawansowanym rozumowaniem i uczeniem agentowym
Hugging Face wprowadza wsparcie dla modeli osadzania wielowektorowego w Sentence Transformers
Gradio wprowadza Workflows: Nowe narzędzie do tworzenia złożonych aplikacji AI

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.