Mistral AI prezentuje Shieldstral 1.0 3B: Adaptacyjny klasyfikator bezpieczeństwa multimodalnego
Mistral AI wprowadza Shieldstral 1.0 3B, innowacyjny klasyfikator bezpieczeństwa multimodalnego, który rewolucjonizuje moderację treści, traktując ją jako jedno pytanie tak/nie, zamiast sztywnej taksonomii kategorii szkó

Mistral AI zaprezentowało Shieldstral 1.0 3B, klasyfikator bezpieczeństwa multimodalnego o otwartych wagach, który adaptuje się do określonych polityk. Model ten podchodzi do moderacji treści w innowacyjny sposób, redukując ją do pojedynczego pytania „tak/nie”, zamiast polegać na stałej taksonomii kategorii szkodliwych treści. W przeciwieństwie do większości modeli zabezpieczających, które mają wbudowane listy kategorii, Shieldstral pozwala operatorom formułować politykę jako pytanie w języku naturalnym w czasie wnioskowania, zwracając skalibrowany wynik bezpieczeństwa.
Innowacyjne podejście do moderacji
Tradycyjne modele zabezpieczające często wymagają ponownego szkolenia, gdy zmienia się kontekst wdrożenia, ponieważ ta sama treść może być akceptowalna w narzędziu do badań cyberbezpieczeństwa, ale szkodliwa na platformie zdrowia psychicznego. Shieldstral odwraca to podejście: polityka bezpieczeństwa jest definiowana dynamicznie przez użytkownika. Model, zbudowany na bazie Ministral-3-3B-Base-2512 z natywnym koderem wizyjnym Pixtral i wydany na licencji Apache 2.0, osiąga średnią 84,9% F1 w zakresie bezpieczeństwa tekstu, dorównując modelowi GPT-OSS-Safeguard-20B. W przypadku bezpieczeństwa multimodalnego wynik wynosi 83,8%, przewyższając wszystkie bazowe modele oceniane przez Mistral.
Wydajność i dostępność
Shieldstral-1.0-3B jest niezwykle wydajny – mieści się w 16 GB pamięci VRAM w formacie BF16 i działa na pojedynczej karcie graficznej. Licencja Apache 2.0 umożliwia jego komercyjne i niekomercyjne wykorzystanie. Obsługiwane ścieżki serwowania obejmują vLLM (≥0.26.0), llama.cpp (poprzez konwersję GGUF z kwantyzacją Q8_0/Q5_K_M/Q4_K_M), SGLang oraz Transformers. Dostrajanie jest wspierane przez Axolotl. Klasyfikator emituje tylko jeden token, co przekłada się na znacznie niższe opóźnienia i koszty w porównaniu do strażników opartych na rozumowaniu, takich jak GPT-OSS-Safeguard-20B.
Moderacja sprowadza się do jednego pytania tak/nie. Stała wiadomość systemowa określa zadanie, a wiadomość użytkownika zawiera trzy pola:
- Instruct: kontekst oceny i rygorystyczność.
- Query: polityka sformułowana jako pojedyncze pytanie tak/nie.
- Document: prompt, odpowiedź, para prompt-odpowiedź lub obraz z opcjonalnym tekstem.
Podczas wnioskowania model de-embeduje się wyłącznie w kierunku identyfikatorów tokenów „tak” i „nie”, a następnie normalizuje je za pomocą funkcji softmax do ciągłego wyniku, progowanego na poziomie τ=0.5. To podejście łączy klasyfikację promptów, moderację odpowiedzi, wykrywanie odmów i wykrywanie toksyczności w jeden problem, a polityka bezpieczeństwa jest w całości zawarta w prompcie. Mistral zaleca jedną politykę na każde wywołanie; dla ogólnego werdyktu bezpieczny/niebezpieczny, należy wymienić kategorie w polu Instruct i zadać jedno szerokie pytanie w Query.
Dane treningowe i generowanie kontrastywne
Kluczem do przewagi Shieldstral nie jest skala, lecz dane. Model został wytrenowany na około 54,1 milionach próbek, w tym 45,2 milionach tekstów open-source, 4,4 milionach syntetycznych tekstów kontrastywnych i 4,5 milionach danych multimodalnych. Warstwa unifikacji oparta na szablonach konwertuje każdy zestaw danych do tego samego formatu instrukcja-zapytanie-dokument, wykorzystując procesory dla poszczególnych zestawów danych, z randomizowanymi sformułowaniami i skalibrowaną rygorystycznością (rygorystyczną dla ataków typu jailbreak, łagodną dla danych dotyczących jakości odpowiedzi).
Szczególnie interesujące jest generowanie kontrastywne. Duży model językowy (LLM) przepisuje bezpieczny tekst na wariant niebezpieczny, który narusza docelową kategorię, ale celowo nie jej pokrewną, tworząc pozytywny i trudny negatywny przykład dla identycznej treści w jednym wywołaniu. Uczy to model, która polityka jest naruszana, zamiast ogólnego podziału na bezpieczne/niebezpieczne. Dane obrazowe, których nie można syntetyzować w taki sam sposób jak tekst, są uzupełniane ogólnymi zestawami danych obrazowych jako negatywami, mutacją zapytań w ramach 14-podkategorii taksonomii wizualnej oraz filtrowaniem przez reranker wizualno-językowy.
Trening obejmuje dostrajanie LoRA, a następnie trójstronne łączenie SLERP: 0.6 public+generowane, 0.3 tylko publiczne, 0.1 Ministral-3B-Instruct.
Wyniki i ograniczenia
W testach bezpieczeństwa tekstu Shieldstral osiągnął 84,9% średniej F1, dorównując GPT-OSS-Safeguard-20B (84,9%) jako najmniejszy model w porównaniu, z wygranymi na ToxicChat (84,1%), HarmBench (99,4%) i Aegis v2 response (87,2%). W zakresie bezpieczeństwa multimodalnego uzyskał 83,8% ogólnie w porównaniu do 77,6% dla OmniGuard-7B, prowadząc przed VLGuard (97,7%) i UnsafeBench (81,8%). LlavaGuard-7B nadal prowadzi w swoim benchmarku z wynikiem 81,4%.
W benchmarku adaptacyjności, zbudowanym na celowo rozbieżnej taksonomii 12 superklas, 26 podkategorii i 52 kategorii liściowych z 90 stałymi zapytaniami, gdzie żadna kategoria liściowa nie odpowiada jeden do jednego danym treningowym, Shieldstral uzyskał 91,3% F1. Jest to wynik nieco niższy niż GPT-OSS-Safeguard-20B (94,1%) i Nemotron-3.5-Safety-4B (91,8%), ale bez generowania śladu rozumowania. Wykrywanie odmów osiągnęło 91,5% ogólnie w porównaniu do 93,7% dla GPT-OSS-Safeguard-20B.
Model wykazuje słabsze strony w wielojęzycznej klasyfikacji promptów, zwłaszcza w języku arabskim i indonezyjskim, oraz w promptach RTP-LX (70,3% w porównaniu do 86,1% dla Nemotron-3.5-Safety-4B). Mistral odnotowuje również zmniejszoną niezawodność w przypadku wrogich lub zaciemnionych danych wejściowych oraz bardzo długich dokumentów. Wytrenowany kontekst obejmuje 32 tysiące tokenów w 12 językach.
Premiera Shieldstral 1.0 3B przez Mistral AI stanowi znaczący krok w kierunku bardziej elastycznych i wydajnych systemów moderacji treści. Możliwość dynamicznego definiowania polityk bezpieczeństwa w języku naturalnym, w połączeniu z imponującymi wynikami w zakresie bezpieczeństwa tekstu i multimodalnego, otwiera nowe perspektywy dla firm i twórców aplikacji, którzy potrzebują precyzyjnych i adaptacyjnych narzędzi do zarządzania treściami generowanymi przez użytkowników. To podejście może zrewolucjonizować sposób, w jaki platformy internetowe podchodzą do kwestii bezpieczeństwa, oferując jednocześnie większą kontrolę i niższe koszty operacyjne.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Mistral AI pozyskuje 3 mld euro w największej rundzie finansowania w Europie, wyceniając się na ponad 21 mld euro
Francuska firma Mistral AI zamknęła rundę finansowania Serii D o wartości 3 miliardów euro, co jest największą tego typu inwestycją w europejską firmę technologiczną. Wycena spółki wzrosła do ponad 21 miliardów euro.
Redakcja Aigest8 wrz 2026
Mistral AI prezentuje Leanstral 1.5: Model agenta kodu dla Lean 4 rozwiązujący 587 problemów PutnamBench
Mistral AI wprowadził Leanstral 1.5, model agenta kodu dla Lean 4, który znacząco poprawia automatyczne dowodzenie twierdzeń i inżynierię dowodów, osiągając imponujące wyniki w benchmarkach.
Redakcja Aigest3 lip 2026

Raport ONZ o kontroli nad AI to dzwonek alarmowy dla każdego z nas
Pierwszy raport panelu naukowego ONZ ds. AI sygnalizuje poważne ryzyko utraty kontroli nad autonomicznymi agentami AI. To nie science fiction, a realne wyzwanie, które musimy potraktować poważnie.
Michał Chmielarz9 godz. temu
NVIDIA prezentuje SoL-Pi: pętle auto-badawcze redukujące ruch tokenów agenta kodującego nawet o 49%
Badacze z NVIDII wprowadzili SoL-Pi, zestaw mechanizmów dla agenta kodującego Pi, które znacząco obniżają zużycie tokenów i koszty API, zachowując wysoką wydajność.
Redakcja Aigest11 godz. temu
SpaceXAI prezentuje Grok 4.7: Większy model bazowy w niezmienionej cenie
SpaceXAI wprowadziło na rynek Grok 4.7, swój nowy flagowy model AI, który oferuje większą bazę i dłuższy cykl uczenia wzmocnionego, zachowując jednocześnie dotychczasową cenę i szybkość działania.
Redakcja Aigest12 godz. temu

Twórca oMLX, Jun Kim, dołącza do Hugging Face, by wspierać społeczność MLX
Jun Kim, twórca i główny opiekun oMLX, dołączył do zespołu Hugging Face. Jego celem jest dalszy rozwój projektu oMLX oraz wspieranie szerszej społeczności MLX, szczególnie w kontekście lokalnej sztucznej inteligencji na
Redakcja Aigest17 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.