Aigest.
Newsy

Google wprowadza Gemini 3.8 Live i 3.8 Live Extended Thinking – nowe modele AI do naturalnej konwersacji głosowej

Google zaprezentowało Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking, swoje najbardziej zaawansowane modele do dialogu na żywo, które mają uczynić interakcje głosowe bardziej naturalnymi i inteligentnymi dzięki ulep

RA

Udostępnij
Google wprowadza Gemini 3.8 Live i 3.8 Live Extended Thinking – nowe modele AI do naturalnej konwersacji głosowej
Fot. Google DeepMind

Google ogłosiło premierę Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking, swoich najnowszych i najbardziej zaawansowanych modeli do dialogu na żywo. Modele te mają na celu uczynienie interakcji głosowych bardziej naturalnymi, płynnymi i inteligentnymi, wprowadzając znaczące ulepszenia w zakresie inteligencji i równoległego rozumowania.

Nowa era interakcji głosowych

Nowe modele Gemini zostały zaprojektowane, aby umożliwić bardziej intuicyjną współpracę i wykonywanie złożonych zadań za pomocą głosu. Potrafią one obsługiwać skomplikowane procesy rozumowania, kontekst wizualny w czasie rzeczywistym oraz wykonywanie zadań w tle bez przerywania konwersacji. Użytkownicy mogą korzystać z tych funkcji za pośrednictwem Gemini API, Google Workspace oraz aplikacji Gemini.

Modele te pozwalają na:

  • Płynne przełączanie się między 97 obsługiwanymi językami w trakcie rozmowy.
  • Wykonywanie narzędzi i wywołań API w tle, podczas gdy konwersacja jest kontynuowana.
  • Przetwarzanie danych wizualnych w czasie zbliżonym do rzeczywistego, co wzbogaca rozmowy o kontekst.

Gemini 3.8 Live Extended Thinking wyróżnia się zdolnością do jednoczesnego rozumowania i mówienia, co jest kluczowe dla zadań wymagających głębszej analizy. Model ten wykorzystuje wczesne wskazówki werbalne, takie jak „Pozwól, że to sprawdzę…”, aby naturalnie potwierdzać prośby i narrację postępów, prowadząc użytkowników przez wieloetapowe zadania wykonywane w tle.

Wydajność i zastosowania

Gemini 3.8 Live Extended Thinking osiągnął pierwsze miejsce w rankingu Artificial Analysis' Speech to Speech Quality Index z wynikiem 82.6, a także przewodzi w realizacji zadań agentowych, uzyskując 68.6% na τ-Voice i 35.1% na benchmarku τ-Voice-banking Sierra. Wykazuje również silne zdolności rozumowania, zdobywając 97.7% na Big Bench Audio, przy zachowaniu konkurencyjnej ceny.

Gemini 3.8 Live zajął drugie miejsce w Speech Agent Arena, co świadczy o jego wysokiej preferencji wśród użytkowników. Oba modele przesuwają granicę Pareto dla złożonych przepływów pracy na benchmarku ServiceNow’s EVA-Bench, równoważąc dokładność z jakością konwersacji.

Przykłady zastosowań obejmują:

  • Prowadzenie onboardingu pracowników w czasie rzeczywistym z wykorzystaniem kontekstu wizualnego.
  • Granie w szachy z wykorzystaniem rozumowania i naturalnego przepływu konwersacji.
  • Przekształcanie szkiców i głosowych informacji zwrotnych w funkcjonalne komponenty React.
  • Koordynowanie wieloetapowych rezerwacji i asynchronicznych wywołań funkcji.
  • Tworzenie planów biznesowych i niestandardowych zestawów narzędzi marketingowych za pomocą mowy.

Integracja i bezpieczeństwo

Modele Live są dostępne dla deweloperów poprzez Gemini Live API, co umożliwia tworzenie wysokowydajnych interfejsów głosowych. Platformy takie jak Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel i Vision Agents już wspierają te modele, zarządzając złożoną infrastrukturą strumieniowania mediów w czasie rzeczywistym. Google współpracuje również z firmami takimi jak Salesforce, Genspark i Lumeris, które wyrażają entuzjazm dla niskiego opóźnienia, płynności i możliwości wywoływania narzędzi przez nowe modele.

Wszystkie treści audio generowane przez produkty AI Google są znakowane niewykrywalnym znakiem wodnym SynthID. Ma to na celu zapewnienie wykrywalności treści generowanych przez AI i zapobieganie dezinformacji, co podkreśla zaangażowanie Google w odpowiedzialne podejście do rozwoju sztucznej inteligencji.

Wprowadzenie Gemini 3.8 Live i 3.8 Live Extended Thinking stanowi znaczący krok w kierunku bardziej naturalnych i efektywnych interakcji człowieka z AI, otwierając nowe możliwości zarówno dla użytkowników indywidualnych, jak i przedsiębiorstw, w zakresie automatyzacji i wspierania złożonych procesów za pomocą głosu. Rozwiązania te mają potencjał do fundamentalnej zmiany sposobu, w jaki komunikujemy się z technologią, czyniąc ją bardziej intuicyjną i wszechstronną.

Źródło: deepmind.google

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Apple wprowadza odnowioną Siri opartą na Google Gemini, ale początkowo bez UE
iOS 27: Siri odzyskuje blask dzięki integracji z Google Gemini i nowym funkcjom
Turyści uratowani po tym, jak Google Gemini doradził im zbyt mało prowiantu na Mount Shasta
Artificial Analysis aktualizuje swój Indeks Inteligencji po kontrowersjach wokół oceny GPT-6 Astra
OpenAI prezentuje GPT-6 Astra: model do zastosowań komputerowych z kontekstem 1.05M i progiem cyberbezpieczeństwa
Google wprowadza Gemini 3.8 Flash, trzeci model Flash w sześć tygodni

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.