Aigest.
Newsy

Ewolucja otwartych modeli ASR w 2026 roku: Poza WER – liczy się licencja i wydajność

Rynek otwartych modeli rozpoznawania mowy (ASR) znacząco ewoluował w ciągu ostatniego roku, odchodząc od dominacji Whisper. Obecnie kluczowe stają się aspekty takie jak licencja, obsługa języków, wsparcie dla strumieniow

RA

Udostępnij
Ewolucja otwartych modeli ASR w 2026 roku: Poza WER – liczy się licencja i wydajność
Fot. MarkTechPost

W ciągu ostatnich dwunastu miesięcy rynek otwartych modeli rozpoznawania mowy (ASR) przestał być zdominowany przez Whisper. W marcu 2026 roku firma Cohere wprowadziła na rynek Transcribe, model o parametrach 2B i licencji Apache 2.0, który z wynikiem 5,42% średniego wskaźnika błędu słów (WER) objął prowadzenie w rankingu Hugging Face Open ASR Leaderboard. Zaledwie pięć tygodni później IBM zaprezentował Granite Speech 4.1 2B, osiągając wynik 5,33%. Od tego czasu modele takie jak ARK-ASR-3B i MOSS-Transcribe-preview-2B uzyskały jeszcze niższe wartości WER.

Różnice między czołowymi modelami w rankingu wynoszą obecnie mniej niż jeden punkt procentowy WER. Oznacza to, że pozycja w rankingu przestała być decydującym czynnikiem przy wyborze modelu. Kluczowe stały się inne aspekty, takie jak licencja, obsługa języków, wsparcie dla strumieniowania oraz koszt za godzinę audio.

Wyzwania w ocenie modeli ASR

Wartość średniego WER w rankingu Open ASR Leaderboard nie jest stała, a modele są oceniane w różny sposób. Na przykład, wynik Cohere na poziomie 5,42% to średnia z ośmiu angielskich zestawów testowych, w tym TED-LIUM. Składa się na niego: AMI (8,13%), Earnings-22 (10,86%), GigaSpeech (9,34%), LibriSpeech clean (1,25%), LibriSpeech other (2,37%), SPGISpeech (3,08%), TED-LIUM (2,49%) i VoxPopuli (5,87%).

Z kolei ARK-ASR-3B osiągnął 5,04% WER, ale jest to średnia z siedmiu zestawów, bez TED-LIUM. Karta modelu MOSS-Transcribe-preview-2B wyraźnie zaznacza, że TED-LIUM został wykluczony z oceny. Ponieważ TED-LIUM jest jednym z łatwiejszych zestawów, jego pominięcie zawyża średnią. Po ponownym przeliczeniu wyników Cohere na tych samych siedmiu zestawach, co ARK, wynik Cohere wzrasta do 5,84%. Podobnie, Granite Speech 4.1 2B zmienia się z 5,33% na 5,65%. Oznacza to, że przewaga ARK jest w rzeczywistości większa, niż sugerowałyby początkowe liczby, co podkreśla, że nie można po prostu odejmować opublikowanych wartości, aby uzyskać miarodajny wynik.

Istnieją również dodatkowe zastrzeżenia:

  • Dopasowanie do rankingu: Niektóre modele, jak MOSS-Transcribe-preview-2B, były dostrajane przy użyciu uczenia ze wzmocnieniem na podzbiorach treningowych Open ASR Leaderboard. Choć jest to ujawnione, oznacza to, że wynik mierzy raczej dopasowanie do benchmarku niż rzeczywiste możliwości modelu.
  • Prywatne dane zmieniają ranking: Firma Appen dostarczyła prywatne zestawy ewaluacyjne obejmujące akcenty australijskie, kanadyjskie, indyjskie i amerykańskie w warunkach skryptowych i konwersacyjnych. Po ich włączeniu, model zoom/scribe_v1 przesuwa się z czwartego miejsca na pierwsze, a lider publicznego rankingu spada. Modele dostrojone do czystej mowy czytanej znacznie gorzej radzą sobie z spontanicznym audio konwersacyjnym.

Zaleca się używanie rankingu do tworzenia krótkiej listy modeli, a nie do wyboru zwycięzcy.

Przegląd kluczowych modeli i ich zastosowań

  • Cohere Transcribe (2B, Apache 2.0, 14 języków): Model ten został pobrany ponad 620 000 razy w ciągu ostatniego miesiąca i jest szeroko wspierany. Osiągnął 61% średniego wskaźnika wygranych w ocenie preferencji ludzkich, przewyższając IBM Granite 4.0 1B Speech (78%) i Whisper large-v3 (64%). Brakuje mu automatycznego wykrywania języka, znaczników czasu i diaryzacji.
  • Granite Speech 4.1 2B (2B, Apache 2.0): Oferuje sześć języków dla ASR oraz dwukierunkowe tłumaczenie mowy, a także biasing listy słów kluczowych. Wytrenowany na 174 000 godzinach danych. IBM oferuje również warianty: -plus z atrybucją mówcy i znacznikami czasu na poziomie słów oraz -nar.
  • Canary-Qwen-2.5B (2.5B, CC-BY-4.0, angielski): Łączy koder FastConformer z dekoderem Qwen3-1.7B. Działa w trybie transkrypcji lub trybie LLM, gdzie dekoder podsumowuje i odpowiada na pytania dotyczące transkrypcji. Osiąga 5,63% WER. Próbkowanie danych AMI zostało zwiększone, co sprzyja transkrypcjom zachowującym niepłynności mowy, co jest przydatne w pracy prawniczej.
  • Qwen3-ASR-1.7B (Apache 2.0): Obsługuje 52 języki i dialekty (30 języków plus 22 chińskie dialekty) z WER 5,76%. Jest to idealny punkt wyjścia dla mowy mandaryńskiej lub chińskich dialektów regionalnych.

Wydajność i przepustowość

Podczas gdy dokładność czołowych modeli różni się o około jeden punkt WER, przepustowość może różnić się o rząd wielkości. Oznacza to, że przepustowość często decyduje o kosztach.

  • Parakeet TDT 0.6B v3 (0.6B, CC-BY-4.0): Lider przepustowości wśród wielojęzycznych modeli otwartych z RTFx 3332,74. Obsługuje 25 języków europejskich z automatycznym wykrywaniem języka. Osiąga 6,32% WER, co jest o około jeden punkt więcej niż Granite 4.1 2B, ale oferuje około czternastokrotnie większą przepustowość audio na sekundę GPU.
  • Granite Speech 4.1 2B-NAR: Model nieautoregresywny, osiągający RTFx ~1820 na jednym H100. Rezygnuje z japońskiego, tłumaczenia mowy i biasingu słów kluczowych na rzecz szybkości.
  • Qwen3-ASR-0.6B: Zachowuje wszystkie 52 języki i osiąga przepustowość 2000x przy współbieżności 128.

Modele strumieniowe i wielojęzyczne

Ocena modeli strumieniowych za pomocą WER jest problematyczna. Voxtral Realtime (7,68%) i Kyutai STT 2.6B (6,40%) są poniżej Whisper, ale ich liczby nie oddają ich przeznaczenia.

  • Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 języków): Model językowy 3.4B z koderem audio 970M, trenowany od podstaw. Opóźnienie transkrypcji jest konfigurowalne od 80 ms do 1200 ms. Mistral zaleca 480 ms jako optymalne ustawienie, gdzie model dorównuje wiodącym modelom offline.
  • Kyutai STT (CC-BY-4.0): Dostępny w dwóch wariantach: ~1B angielsko-francuski z opóźnieniem 0,5 s i wbudowanym semantycznym detektorem aktywności głosowej, oraz 2.6B tylko angielski z opóźnieniem 2,5 s. Dla agentów głosowych, semantyczny VAD jest ważniejszy niż opóźnienie transkrypcji.
  • Meta Omnilingual ASR (Apache 2.0, korpus CC-BY): Nie konkuruje w WER, ale obsługuje ponad 1600 języków natywnie i rozszerza się do ponad 5400 poprzez zero-shot in-context learning. Wariant 7B LLM-ASR osiąga wskaźnik błędu znaków poniżej 10% w 78% obsługiwanych języków, w tym w ponad 500 językach, które nigdy wcześniej nie były obsługiwane przez żaden system ASR.

Licencje i ich znaczenie

Licencja jest kluczowym czynnikiem decyzyjnym, szczególnie w kontekście komercyjnym:

  • Apache 2.0: Cohere Transcribe, Granite Speech 4.1 (wszystkie trzy warianty), Qwen3-ASR (oba rozmiary), Voxtral Mini Realtime, Omnilingual ASR, ARK-ASR, MOSS-Transcribe. Brak obowiązku atrybucji, nieograniczone zastosowanie komercyjne. Repozytorium Cohere wymaga jednak podania danych kontaktowych.
  • MIT: Whisper large-v3. Najbardziej liberalna opcja. Ekosystem runtime (whisper.cpp, faster-whisper, WhisperX) nie ma odpowiednika wśród nowszych wydań. Nadal jest to domyślny wybór dla wielu projektów, gdy wymagane jest wsparcie dla wielu języków i sprzętu bez konieczności angażowania prawnika.
  • CC-BY-4.0: Canary-Qwen-2.5B, Parakeet TDT 0.6B v3, Kyutai STT. Możliwe zastosowanie komercyjne, ale wymagana jest atrybucja. Jest to najczęstszy powód, dla którego zespoły decydują się na model, który nie jest najbardziej dokładny, ale spełnia wymogi licencyjne.

Meta Omnilingual ASR łączy te dwa podejścia: Apache 2.0 dla modeli i CC-BY dla korpusu.

Znaczenie ewolucji otwartych modeli ASR

Podsumowując, rok 2026 nie przyniósł jednego zwycięskiego modelu, ale raczej potwierdził, że otwarte modele o wadze 2B z liberalnymi licencjami przewyższają możliwości płatnych API sprzed osiemnastu miesięcy. Decyzja o wyborze modelu stała się kwestią zaopatrzeniową, a nie badawczą. Rankingi są dynamiczne i często się zmieniają, a wszystkie dane zostały zweryfikowane na podstawie pierwotnych źródeł 23 lipca 2026 roku. Ta ewolucja otwiera nowe możliwości dla deweloperów i firm, umożliwiając im wdrażanie zaawansowanych rozwiązań ASR bez ponoszenia wysokich kosztów licencyjnych czy uzależnienia od jednego dostawcy. Rynek staje się bardziej konkurencyjny, co sprzyja innowacjom i dostępności technologii rozpoznawania mowy dla szerszego grona użytkowników.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Cohere udostępnia otwarty model Transcribe Arabic dla mowy arabskiej
Szef Mistral ostrzega przed zamkniętymi modelami AI: Firmy tracą kontrolę nad danymi
Google wprowadza nowe modele Gemini Flash: 3.6 Flash, 3.5 Flash-Lite i 3.5 Flash Cyber
Alibaba prezentuje Qwen 3.8: nowy model AI z 2,4 biliona parametrów, konkurencja dla Kimi K3
Reflection AI zawiera miliardową umowę z Nebius na zasoby obliczeniowe
Niemieckie konsorcjum AI prezentuje Soofi S: otwarty model 30B dominujący w benchmarkach angielskich i niemieckich

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.