Superwhisper udostępnia S1-mini: model normalizujący tekst z otwartymi wagami
Superwhisper wprowadza S1-mini, model normalizujący tekst z otwartymi wagami, który przekształca surowe transkrypcje mowy w czysty, pisany tekst, usuwając wypełniacze i poprawiając formatowanie.

Firma Superwhisper zaprezentowała rodzinę modeli S1, w skład której wchodzą S1-Voice, S1-Language oraz S1-mini. O ile S1-Voice to chmurowy model zamiany mowy na tekst, a S1-Language to chmurowy model do formatowania i porządkowania tekstu, o tyle S1-mini wyróżnia się udostępnieniem z otwartymi wagami na platformie Hugging Face.
S1-mini to model normalizujący tekst o rozmiarze 0.6B parametrów, a nie transkrybent czy model konwersacyjny. Jego zadaniem jest przetwarzanie surowych transkrypcji pochodzących z systemów automatycznego rozpoznawania mowy (ASR) i przekształcanie ich w czysty, pisany tekst. Model usuwa słowa wypełniające, rozwiązuje samokorekty, dodaje interpunkcję i wielkie litery, a także zapisuje liczby, daty, waluty i adresy e-mail w formie pisanej. W wersji v1 model obsługuje wyłącznie język angielski i został dostrojony na bazie Qwen/Qwen3-0.6B.
Jak działa S1-mini?
S1-mini funkcjonuje jako post-procesor dla transkrypcji ASR. Schemat jego działania wygląda następująco:
audio → ASR (Whisper, Parakeet, …) → S1-mini → czysty tekst
Model skutecznie eliminuje słowa takie jak „yyy”, „eee”, koryguje błędne początki zdań i samokorekty mówcy, stosuje odpowiednią interpunkcję i kapitalizację, a także konwertuje wypowiadane liczby, daty, godziny, waluty i adresy e-mail na ich pisemne odpowiedniki. Przykładowo, wypowiedź „support at superwhisper dot com” zostanie przekształcona w „[email protected]”.
Model S1-mini opiera się na architekturze Qwen3-0.6B i posiada 596 milionów unikalnych parametrów (0.44B bez embeddingów), 28 warstw, 16 głowic zapytań i 8 głowic klucz/wartość z GQA, a także wagi w formacie BF16. Zalecana długość danych wejściowych to około 1000 tokenów.
Sterowanie i ograniczenia modelu
S1-mini przyjmuje stały prompt systemowy, linię kontrolną, a następnie surową transkrypcję. Linia kontrolna składa się z trzech niezależnych osi:
- Styling:
casual,semi-casual,semi-formal,formal. - Structure:
prose(proza) lublists(listy). - Context:
general(ogólny) lubemail.
Każda kombinacja tych wartości została uwzględniona podczas treningu. Wprowadzenie wartości spoza tych zestawów lub zmiana promptu systemowego może prowadzić do pogorszenia jakości lub zniekształcenia wyników. Warto zauważyć, że aplikacja Superwhisper oferuje pięciostopniowy suwak tonu, który dodaje preset „balanced”, podczas gdy dokumentacja otwartych wag wymienia cztery trenowane wartości Stylingu.
Model jest celowo ograniczony w swoim działaniu. Nie dodaje treści, które nie zostały wypowiedziane, nie koryguje faktów, nie łagodzi wulgaryzmów ani nie przepisuje dialektów. Jeśli dane wejściowe składają się wyłącznie ze słów wypełniających, model zwraca pusty ciąg znaków, co powinno być traktowane jako prawidłowy wynik przez integracje.
Wyniki i wydajność
Superwhisper ocenił S1-mini na zbiorze testowym składającym się z 7 519 przypadków z 104 transkrypcji. Model osiągnął 94.8% dokładności tokenów (mierzonej zachłannie na skwantowanej wersji Q4_K_M) oraz 11.6% wskaźnik błędu edycji tekstu. W przypadku tekstu formatowanego jako e-mail, model identyfikuje linię powitalną w 99.3% przypadków, a zakończenie w 97.9%. Poprawnie dopasowuje strukturę wyjściową (lista vs. akapit) w 97.6% przypadków i generuje dokładne adresy e-mail w 92% przypadków. Mniej niż 1% generacji wykazuje zapętlenie lub obcięcie, a model poprawnie wstrzymuje generowanie wyników w 98.6% przypadków, gdy nic nie powinno być transkrybowane. Należy zaznaczyć, że są to dane dostarczone przez producenta na wewnętrznym zbiorze testowym, a nie wyniki niezależnych badań.
S1-Voice i S1-Language
Oprócz S1-mini, Superwhisper oferuje również:
- S1-Voice: Chmurowy model zamiany mowy na tekst, który według Superwhisper jest do 46 razy szybszy niż czas mówienia. Większość dyktand poniżej 30 sekund pojawia się 0.32 sekundy po zakończeniu mówienia. Model osiąga średnio 6.8% wskaźnika błędu słów na ośmiu zbiorach danych, w tym nagraniach spotkań i rozmowach o wynikach finansowych, a na zbiorze LibriSpeech spada do 2.2%. Superwhisper twierdzi, że ten średni wynik był najniższy spośród 15 testowanych modeli.
- S1-Language: Chmurowy model do porządkowania, formatowania i podsumowywania tekstu, który pojawia się w wyborze modeli obok rozwiązań od Anthropic, OpenAI i Groq. Zalecane domyślne konfiguracje to Cohere Transcribe plus S1-mini offline, lub S1-Voice plus S1-Language w chmurze.
Udostępnienie S1-mini z otwartymi wagami stanowi istotny krok w demokratyzacji narzędzi do przetwarzania języka naturalnego, umożliwiając deweloperom i badaczom swobodne wykorzystywanie i rozwijanie technologii normalizacji tekstu. Może to przyspieszyć innowacje w dziedzinach takich jak transkrypcja medyczna, obsługa klienta czy automatyzacja procesów biznesowych, gdzie czysty i ustrukturyzowany tekst jest kluczowy.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Dozowanie pamięci dla agentów AI: Klucz do optymalnej wydajności i kosztów
Nowe badanie IBM Research i Hugging Face pokazuje, że efektywność agentów AI zależy od odpowiedniego dostosowania ilości pamięci do ich możliwości, a nie od jej kumulowania. Odpowiednie dozowanie pamięci może znacząco zw
Redakcja Aigest2 dni temu
Modele osadzania wielowektorowego (Late Interaction) z Sentence Transformers
Hugging Face wprowadza nową kategorię modeli osadzania wielowektorowego, które oferują lepszą wydajność w wyszukiwaniu semantycznym, szczególnie w przypadku długich dokumentów, dzięki zastosowaniu architektur Late Intera
Redakcja Aigest3 dni temu
Stan otwartych modeli AI: Obserwacje z lata 2026
Hugging Face opublikowało raport "State of Open Models: Summer 2026 Observations", analizujący dynamiczny rozwój otwartych modeli sztucznej inteligencji. Raport podkreśla ich rosnące znaczenie i wpływ na innowacje w bran
Redakcja Aigest14 sie 2026

Hugging Face, Strands i LeRobot łączą siły dla usprawnienia rozwoju agentów AI
Hugging Face ogłosiło współpracę ze Strands i LeRobot, aby stworzyć zintegrowane środowisko do nagrywania, trenowania i wdrażania agentów AI. Inicjatywa ma na celu uproszczenie procesu rozwoju sztucznej inteligencji.
Redakcja Aigest13 sie 2026

Baseten dołącza do dostawców inferencji na platformie Hugging Face
Firma Baseten, specjalizująca się w wdrażaniu modeli uczenia maszynowego, stała się nowym dostawcą inferencji na platformie Hugging Face, oferującym skalowalne i efektywne kosztowo rozwiązania.
Redakcja Aigest6 sie 2026

LiquidAI wprowadza LFM2.5-2.6B: Małe modele językowe dla agentów lokalnych
LiquidAI zaprezentowało LFM2.5-2.6B, nową rodzinę małych modeli językowych (SLM) o rozmiarze 2,6 miliarda parametrów, zaprojektowanych do działania na urządzeniach brzegowych.
Redakcja Aigest4 sie 2026
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.