Aigest.
Newsy

Superwhisper udostępnia S1-mini: model normalizujący tekst z otwartymi wagami

Superwhisper wprowadza S1-mini, model normalizujący tekst z otwartymi wagami, który przekształca surowe transkrypcje mowy w czysty, pisany tekst, usuwając wypełniacze i poprawiając formatowanie.

RA

Udostępnij
Superwhisper udostępnia S1-mini: model normalizujący tekst z otwartymi wagami
Fot. MarkTechPost

Firma Superwhisper zaprezentowała rodzinę modeli S1, w skład której wchodzą S1-Voice, S1-Language oraz S1-mini. O ile S1-Voice to chmurowy model zamiany mowy na tekst, a S1-Language to chmurowy model do formatowania i porządkowania tekstu, o tyle S1-mini wyróżnia się udostępnieniem z otwartymi wagami na platformie Hugging Face.

S1-mini to model normalizujący tekst o rozmiarze 0.6B parametrów, a nie transkrybent czy model konwersacyjny. Jego zadaniem jest przetwarzanie surowych transkrypcji pochodzących z systemów automatycznego rozpoznawania mowy (ASR) i przekształcanie ich w czysty, pisany tekst. Model usuwa słowa wypełniające, rozwiązuje samokorekty, dodaje interpunkcję i wielkie litery, a także zapisuje liczby, daty, waluty i adresy e-mail w formie pisanej. W wersji v1 model obsługuje wyłącznie język angielski i został dostrojony na bazie Qwen/Qwen3-0.6B.

Jak działa S1-mini?

S1-mini funkcjonuje jako post-procesor dla transkrypcji ASR. Schemat jego działania wygląda następująco:

audio → ASR (Whisper, Parakeet, …) → S1-mini → czysty tekst

Model skutecznie eliminuje słowa takie jak „yyy”, „eee”, koryguje błędne początki zdań i samokorekty mówcy, stosuje odpowiednią interpunkcję i kapitalizację, a także konwertuje wypowiadane liczby, daty, godziny, waluty i adresy e-mail na ich pisemne odpowiedniki. Przykładowo, wypowiedź „support at superwhisper dot com” zostanie przekształcona w „[email protected]”.

Model S1-mini opiera się na architekturze Qwen3-0.6B i posiada 596 milionów unikalnych parametrów (0.44B bez embeddingów), 28 warstw, 16 głowic zapytań i 8 głowic klucz/wartość z GQA, a także wagi w formacie BF16. Zalecana długość danych wejściowych to około 1000 tokenów.

Sterowanie i ograniczenia modelu

S1-mini przyjmuje stały prompt systemowy, linię kontrolną, a następnie surową transkrypcję. Linia kontrolna składa się z trzech niezależnych osi:

  • Styling: casual, semi-casual, semi-formal, formal.
  • Structure: prose (proza) lub lists (listy).
  • Context: general (ogólny) lub email.

Każda kombinacja tych wartości została uwzględniona podczas treningu. Wprowadzenie wartości spoza tych zestawów lub zmiana promptu systemowego może prowadzić do pogorszenia jakości lub zniekształcenia wyników. Warto zauważyć, że aplikacja Superwhisper oferuje pięciostopniowy suwak tonu, który dodaje preset „balanced”, podczas gdy dokumentacja otwartych wag wymienia cztery trenowane wartości Stylingu.

Model jest celowo ograniczony w swoim działaniu. Nie dodaje treści, które nie zostały wypowiedziane, nie koryguje faktów, nie łagodzi wulgaryzmów ani nie przepisuje dialektów. Jeśli dane wejściowe składają się wyłącznie ze słów wypełniających, model zwraca pusty ciąg znaków, co powinno być traktowane jako prawidłowy wynik przez integracje.

Wyniki i wydajność

Superwhisper ocenił S1-mini na zbiorze testowym składającym się z 7 519 przypadków z 104 transkrypcji. Model osiągnął 94.8% dokładności tokenów (mierzonej zachłannie na skwantowanej wersji Q4_K_M) oraz 11.6% wskaźnik błędu edycji tekstu. W przypadku tekstu formatowanego jako e-mail, model identyfikuje linię powitalną w 99.3% przypadków, a zakończenie w 97.9%. Poprawnie dopasowuje strukturę wyjściową (lista vs. akapit) w 97.6% przypadków i generuje dokładne adresy e-mail w 92% przypadków. Mniej niż 1% generacji wykazuje zapętlenie lub obcięcie, a model poprawnie wstrzymuje generowanie wyników w 98.6% przypadków, gdy nic nie powinno być transkrybowane. Należy zaznaczyć, że są to dane dostarczone przez producenta na wewnętrznym zbiorze testowym, a nie wyniki niezależnych badań.

S1-Voice i S1-Language

Oprócz S1-mini, Superwhisper oferuje również:

  • S1-Voice: Chmurowy model zamiany mowy na tekst, który według Superwhisper jest do 46 razy szybszy niż czas mówienia. Większość dyktand poniżej 30 sekund pojawia się 0.32 sekundy po zakończeniu mówienia. Model osiąga średnio 6.8% wskaźnika błędu słów na ośmiu zbiorach danych, w tym nagraniach spotkań i rozmowach o wynikach finansowych, a na zbiorze LibriSpeech spada do 2.2%. Superwhisper twierdzi, że ten średni wynik był najniższy spośród 15 testowanych modeli.
  • S1-Language: Chmurowy model do porządkowania, formatowania i podsumowywania tekstu, który pojawia się w wyborze modeli obok rozwiązań od Anthropic, OpenAI i Groq. Zalecane domyślne konfiguracje to Cohere Transcribe plus S1-mini offline, lub S1-Voice plus S1-Language w chmurze.

Udostępnienie S1-mini z otwartymi wagami stanowi istotny krok w demokratyzacji narzędzi do przetwarzania języka naturalnego, umożliwiając deweloperom i badaczom swobodne wykorzystywanie i rozwijanie technologii normalizacji tekstu. Może to przyspieszyć innowacje w dziedzinach takich jak transkrypcja medyczna, obsługa klienta czy automatyzacja procesów biznesowych, gdzie czysty i ustrukturyzowany tekst jest kluczowy.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Dozowanie pamięci dla agentów AI: Klucz do optymalnej wydajności i kosztów
Modele osadzania wielowektorowego (Late Interaction) z Sentence Transformers
Stan otwartych modeli AI: Obserwacje z lata 2026
Hugging Face, Strands i LeRobot łączą siły dla usprawnienia rozwoju agentów AI
Baseten dołącza do dostawców inferencji na platformie Hugging Face
LiquidAI wprowadza LFM2.5-2.6B: Małe modele językowe dla agentów lokalnych

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.