Google wprowadza Gemini 3.8 Live i 3.8 Live Extended Thinking – nowe modele AI do naturalnej konwersacji głosowej
Google zaprezentowało Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking, swoje najbardziej zaawansowane modele do dialogu na żywo, które mają uczynić interakcje głosowe bardziej naturalnymi i inteligentnymi dzięki ulep

Google ogłosiło premierę Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking, swoich najnowszych i najbardziej zaawansowanych modeli do dialogu na żywo. Modele te mają na celu uczynienie interakcji głosowych bardziej naturalnymi, płynnymi i inteligentnymi, wprowadzając znaczące ulepszenia w zakresie inteligencji i równoległego rozumowania.
Nowa era interakcji głosowych
Nowe modele Gemini zostały zaprojektowane, aby umożliwić bardziej intuicyjną współpracę i wykonywanie złożonych zadań za pomocą głosu. Potrafią one obsługiwać skomplikowane procesy rozumowania, kontekst wizualny w czasie rzeczywistym oraz wykonywanie zadań w tle bez przerywania konwersacji. Użytkownicy mogą korzystać z tych funkcji za pośrednictwem Gemini API, Google Workspace oraz aplikacji Gemini.
Modele te pozwalają na:
- Płynne przełączanie się między 97 obsługiwanymi językami w trakcie rozmowy.
- Wykonywanie narzędzi i wywołań API w tle, podczas gdy konwersacja jest kontynuowana.
- Przetwarzanie danych wizualnych w czasie zbliżonym do rzeczywistego, co wzbogaca rozmowy o kontekst.
Gemini 3.8 Live Extended Thinking wyróżnia się zdolnością do jednoczesnego rozumowania i mówienia, co jest kluczowe dla zadań wymagających głębszej analizy. Model ten wykorzystuje wczesne wskazówki werbalne, takie jak „Pozwól, że to sprawdzę…”, aby naturalnie potwierdzać prośby i narrację postępów, prowadząc użytkowników przez wieloetapowe zadania wykonywane w tle.
Wydajność i zastosowania
Gemini 3.8 Live Extended Thinking osiągnął pierwsze miejsce w rankingu Artificial Analysis' Speech to Speech Quality Index z wynikiem 82.6, a także przewodzi w realizacji zadań agentowych, uzyskując 68.6% na τ-Voice i 35.1% na benchmarku τ-Voice-banking Sierra. Wykazuje również silne zdolności rozumowania, zdobywając 97.7% na Big Bench Audio, przy zachowaniu konkurencyjnej ceny.
Gemini 3.8 Live zajął drugie miejsce w Speech Agent Arena, co świadczy o jego wysokiej preferencji wśród użytkowników. Oba modele przesuwają granicę Pareto dla złożonych przepływów pracy na benchmarku ServiceNow’s EVA-Bench, równoważąc dokładność z jakością konwersacji.
Przykłady zastosowań obejmują:
- Prowadzenie onboardingu pracowników w czasie rzeczywistym z wykorzystaniem kontekstu wizualnego.
- Granie w szachy z wykorzystaniem rozumowania i naturalnego przepływu konwersacji.
- Przekształcanie szkiców i głosowych informacji zwrotnych w funkcjonalne komponenty React.
- Koordynowanie wieloetapowych rezerwacji i asynchronicznych wywołań funkcji.
- Tworzenie planów biznesowych i niestandardowych zestawów narzędzi marketingowych za pomocą mowy.
Integracja i bezpieczeństwo
Modele Live są dostępne dla deweloperów poprzez Gemini Live API, co umożliwia tworzenie wysokowydajnych interfejsów głosowych. Platformy takie jak Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel i Vision Agents już wspierają te modele, zarządzając złożoną infrastrukturą strumieniowania mediów w czasie rzeczywistym. Google współpracuje również z firmami takimi jak Salesforce, Genspark i Lumeris, które wyrażają entuzjazm dla niskiego opóźnienia, płynności i możliwości wywoływania narzędzi przez nowe modele.
Wszystkie treści audio generowane przez produkty AI Google są znakowane niewykrywalnym znakiem wodnym SynthID. Ma to na celu zapewnienie wykrywalności treści generowanych przez AI i zapobieganie dezinformacji, co podkreśla zaangażowanie Google w odpowiedzialne podejście do rozwoju sztucznej inteligencji.
Wprowadzenie Gemini 3.8 Live i 3.8 Live Extended Thinking stanowi znaczący krok w kierunku bardziej naturalnych i efektywnych interakcji człowieka z AI, otwierając nowe możliwości zarówno dla użytkowników indywidualnych, jak i przedsiębiorstw, w zakresie automatyzacji i wspierania złożonych procesów za pomocą głosu. Rozwiązania te mają potencjał do fundamentalnej zmiany sposobu, w jaki komunikujemy się z technologią, czyniąc ją bardziej intuicyjną i wszechstronną.
Źródło: deepmind.google
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Apple wprowadza odnowioną Siri opartą na Google Gemini, ale początkowo bez UE
Apple udostępnia nową generację Siri, zasilaną modelami Google Gemini, oferującą zaawansowane funkcje kontekstowe i integrację z aplikacjami, jednak początkowo nie będzie dostępna w Unii Europejskiej.
Redakcja Aigestwczoraj

iOS 27: Siri odzyskuje blask dzięki integracji z Google Gemini i nowym funkcjom
Najnowsza aktualizacja systemu iOS 27 znacząco odmienia asystenta Siri, czyniąc go bardziej użytecznym i kontekstowym. Użytkownicy zauważają, że po latach marginalnego wykorzystania, Siri staje się kluczowym narzędziem d
Redakcja Aigest2 dni temu

Turyści uratowani po tym, jak Google Gemini doradził im zbyt mało prowiantu na Mount Shasta
Trzech turystów zostało uratowanych z kalifornijskiej góry Mount Shasta po tym, jak ich wyprawa, zaplanowana z pomocą chatbota Google Gemini, zakończyła się wielogodzinną akcją ratunkową. AI doradziło im zabranie zbyt ma
Redakcja Aigest5 wrz 2026

Artificial Analysis aktualizuje swój Indeks Inteligencji po kontrowersjach wokół oceny GPT-6 Astra
Firma Artificial Analysis wprowadziła wersję 4.2 swojego Indeksu Inteligencji, reagując na krytykę dotyczącą niedoszacowania postępów modelu GPT-6 Astra. Aktualizacja zmienia pozycję Astry w rankingu i wprowadza nowe ben
Redakcja Aigest5 wrz 2026
OpenAI prezentuje GPT-6 Astra: model do zastosowań komputerowych z kontekstem 1.05M i progiem cyberbezpieczeństwa
OpenAI wprowadziło GPT-6 Astra, nowy model AI przeznaczony do interakcji z komputerem, oferujący rozszerzony kontekst 1.05 miliona tokenów. Jest to pierwszy model firmy, który przekroczył krytyczny próg cyberbezpieczeńst
Redakcja Aigest3 wrz 2026

Google wprowadza Gemini 3.8 Flash, trzeci model Flash w sześć tygodni
Google zaprezentowało Gemini 3.8 Flash, swój trzeci model Flash w ciągu zaledwie sześciu tygodni, oferując ulepszone możliwości rozumowania i kodowania, a także specjalistyczną wersję Cyber do wykrywania luk.
Redakcja Aigest2 wrz 2026
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.