Aigest.
Narzędzia AI

OpenAI udostępnia GPT-Live-1 API: model, który słucha i mówi jednocześnie

OpenAI udostępnia deweloperom API dla swojego modelu mowy GPT-Live-1, który potrafi jednocześnie słuchać i mówić, oferując znaczną poprawę interaktywności i wydajności w porównaniu do poprzedników.

RA

Udostępnij
OpenAI udostępnia GPT-Live-1 API: model, który słucha i mówi jednocześnie
Fot. The Decoder

OpenAI udostępnia deweloperom API swojego najnowszego modelu mowy, GPT-Live-1, który wyróżnia się zdolnością do jednoczesnego słuchania i mówienia, co określane jest mianem funkcji „pełnego dupleksu”. Technologia ta jest już zaimplementowana w ChatGPT, a teraz twórcy aplikacji mogą integrować ją ze swoimi rozwiązaniami. Model ten umożliwia deweloperom dobieranie różnych modeli backendowych, aby dopasować głębokość rozumowania, szybkość i koszty do konkretnych zastosowań. Warto jednak zauważyć, że koszt użytkowania wynosi 0,05 dolara za minutę.

Znacząca poprawa wydajności i funkcjonalności

GPT-Live-1 wykazuje znaczącą przewagę nad swoimi poprzednikami w testach przeprowadzonych przez OpenAI. W testach interaktywności pełnego dupleksu osiągnął wynik 80,1 procent, podczas gdy GPT-Realtime-2.1 uzyskał jedynie 45,4 procent. Czas oczekiwania na reakcję (turn-taking latency) został skrócony z 1,4 sekundy do zaledwie 0,8 sekundy, co znacząco poprawia płynność konwersacji. Precyzja wywoływania narzędzi (tool-calling accuracy) wzrosła z 60 procent do 87 procent. W benchmarku wsparcia głosowego dla bankowości, GPT-Live-1 osiągnął wskaźnik zdawalności na poziomie 32 procent, co stanowi znaczący wzrost w porównaniu do 12,4 procent poprzedniego modelu.

Model GPT-Live-1 oferuje również dwanaście nowych głosów, obejmujących różne akcenty, dialekty i języki, co zwiększa jego wszechstronność i możliwości personalizacji. Dodatkowo, model dostarcza transkrypcje ASR (automatyczne rozpoznawanie mowy) oraz tekst odpowiedzi od razu po przetworzeniu. Pełne szczegóły dotyczące API zostaną udostępnione w dokumentacji.

Zastosowania rynkowe i perspektywy

Jednym z pierwszych komercyjnych zastosowań GPT-Live-1 jest jego integracja w firmie Yelp, gdzie model jest wykorzystywany do obsługi telefonicznych rezerwacji. Według Alexa Levy'ego, dyrektora technicznego Yelp, wdrożenie to przyczyniło się do lepszej obsługi połączeń. To pokazuje potencjał modelu w usprawnianiu interakcji głosowych w sektorze usług, gdzie płynność i precyzja komunikacji są kluczowe.

Udostępnienie GPT-Live-1 jako API otwiera nowe możliwości dla deweloperów, umożliwiając tworzenie bardziej naturalnych i efektywnych aplikacji głosowych. Znacząca poprawa w kluczowych metrykach wydajności, takich jak interaktywność pełnego dupleksu i precyzja wywoływania narzędzi, wskazuje na to, że technologia ta może stać się standardem w branży, rewolucjonizując sposób, w jaki użytkownicy wchodzą w interakcje z systemami opartymi na sztucznej inteligencji.

Źródło: the-decoder.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

OpenAI pod presją: zarzuty o naciski na matematyka w sprawie przełomu w równaniach Naviera-Stokesa
OpenAI prezentuje GPT-6 Astra: model do zastosowań komputerowych z kontekstem 1.05M i progiem cyberbezpieczeństwa
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
Tajemnicze działania agentów AI: OpenAI pod lupą, Anthropic zaostrza kontrolę, a przejrzystość modeli maleje
Zasilanie AI to problem architektoniczny, a nie tylko kwestia generacji energii
Pozew przeciwko OpenAI: ChatGPT miał pogłębić urojenia religijne użytkownika

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.