Aigest.
Newsy

Mistral AI prezentuje Shieldstral 1.0 3B: Adaptacyjny klasyfikator bezpieczeństwa multimodalnego

Mistral AI wprowadza Shieldstral 1.0 3B, innowacyjny klasyfikator bezpieczeństwa multimodalnego, który rewolucjonizuje moderację treści, traktując ją jako jedno pytanie tak/nie, zamiast sztywnej taksonomii kategorii szkó

RA

Udostępnij
Mistral AI prezentuje Shieldstral 1.0 3B: Adaptacyjny klasyfikator bezpieczeństwa multimodalnego
Fot. MarkTechPost

Mistral AI zaprezentowało Shieldstral 1.0 3B, klasyfikator bezpieczeństwa multimodalnego o otwartych wagach, który adaptuje się do określonych polityk. Model ten podchodzi do moderacji treści w innowacyjny sposób, redukując ją do pojedynczego pytania „tak/nie”, zamiast polegać na stałej taksonomii kategorii szkodliwych treści. W przeciwieństwie do większości modeli zabezpieczających, które mają wbudowane listy kategorii, Shieldstral pozwala operatorom formułować politykę jako pytanie w języku naturalnym w czasie wnioskowania, zwracając skalibrowany wynik bezpieczeństwa.

Innowacyjne podejście do moderacji

Tradycyjne modele zabezpieczające często wymagają ponownego szkolenia, gdy zmienia się kontekst wdrożenia, ponieważ ta sama treść może być akceptowalna w narzędziu do badań cyberbezpieczeństwa, ale szkodliwa na platformie zdrowia psychicznego. Shieldstral odwraca to podejście: polityka bezpieczeństwa jest definiowana dynamicznie przez użytkownika. Model, zbudowany na bazie Ministral-3-3B-Base-2512 z natywnym koderem wizyjnym Pixtral i wydany na licencji Apache 2.0, osiąga średnią 84,9% F1 w zakresie bezpieczeństwa tekstu, dorównując modelowi GPT-OSS-Safeguard-20B. W przypadku bezpieczeństwa multimodalnego wynik wynosi 83,8%, przewyższając wszystkie bazowe modele oceniane przez Mistral.

Wydajność i dostępność

Shieldstral-1.0-3B jest niezwykle wydajny – mieści się w 16 GB pamięci VRAM w formacie BF16 i działa na pojedynczej karcie graficznej. Licencja Apache 2.0 umożliwia jego komercyjne i niekomercyjne wykorzystanie. Obsługiwane ścieżki serwowania obejmują vLLM (≥0.26.0), llama.cpp (poprzez konwersję GGUF z kwantyzacją Q8_0/Q5_K_M/Q4_K_M), SGLang oraz Transformers. Dostrajanie jest wspierane przez Axolotl. Klasyfikator emituje tylko jeden token, co przekłada się na znacznie niższe opóźnienia i koszty w porównaniu do strażników opartych na rozumowaniu, takich jak GPT-OSS-Safeguard-20B.

Moderacja sprowadza się do jednego pytania tak/nie. Stała wiadomość systemowa określa zadanie, a wiadomość użytkownika zawiera trzy pola:

  • Instruct: kontekst oceny i rygorystyczność.
  • Query: polityka sformułowana jako pojedyncze pytanie tak/nie.
  • Document: prompt, odpowiedź, para prompt-odpowiedź lub obraz z opcjonalnym tekstem.

Podczas wnioskowania model de-embeduje się wyłącznie w kierunku identyfikatorów tokenów „tak” i „nie”, a następnie normalizuje je za pomocą funkcji softmax do ciągłego wyniku, progowanego na poziomie τ=0.5. To podejście łączy klasyfikację promptów, moderację odpowiedzi, wykrywanie odmów i wykrywanie toksyczności w jeden problem, a polityka bezpieczeństwa jest w całości zawarta w prompcie. Mistral zaleca jedną politykę na każde wywołanie; dla ogólnego werdyktu bezpieczny/niebezpieczny, należy wymienić kategorie w polu Instruct i zadać jedno szerokie pytanie w Query.

Dane treningowe i generowanie kontrastywne

Kluczem do przewagi Shieldstral nie jest skala, lecz dane. Model został wytrenowany na około 54,1 milionach próbek, w tym 45,2 milionach tekstów open-source, 4,4 milionach syntetycznych tekstów kontrastywnych i 4,5 milionach danych multimodalnych. Warstwa unifikacji oparta na szablonach konwertuje każdy zestaw danych do tego samego formatu instrukcja-zapytanie-dokument, wykorzystując procesory dla poszczególnych zestawów danych, z randomizowanymi sformułowaniami i skalibrowaną rygorystycznością (rygorystyczną dla ataków typu jailbreak, łagodną dla danych dotyczących jakości odpowiedzi).

Szczególnie interesujące jest generowanie kontrastywne. Duży model językowy (LLM) przepisuje bezpieczny tekst na wariant niebezpieczny, który narusza docelową kategorię, ale celowo nie jej pokrewną, tworząc pozytywny i trudny negatywny przykład dla identycznej treści w jednym wywołaniu. Uczy to model, która polityka jest naruszana, zamiast ogólnego podziału na bezpieczne/niebezpieczne. Dane obrazowe, których nie można syntetyzować w taki sam sposób jak tekst, są uzupełniane ogólnymi zestawami danych obrazowych jako negatywami, mutacją zapytań w ramach 14-podkategorii taksonomii wizualnej oraz filtrowaniem przez reranker wizualno-językowy.

Trening obejmuje dostrajanie LoRA, a następnie trójstronne łączenie SLERP: 0.6 public+generowane, 0.3 tylko publiczne, 0.1 Ministral-3B-Instruct.

Wyniki i ograniczenia

W testach bezpieczeństwa tekstu Shieldstral osiągnął 84,9% średniej F1, dorównując GPT-OSS-Safeguard-20B (84,9%) jako najmniejszy model w porównaniu, z wygranymi na ToxicChat (84,1%), HarmBench (99,4%) i Aegis v2 response (87,2%). W zakresie bezpieczeństwa multimodalnego uzyskał 83,8% ogólnie w porównaniu do 77,6% dla OmniGuard-7B, prowadząc przed VLGuard (97,7%) i UnsafeBench (81,8%). LlavaGuard-7B nadal prowadzi w swoim benchmarku z wynikiem 81,4%.

W benchmarku adaptacyjności, zbudowanym na celowo rozbieżnej taksonomii 12 superklas, 26 podkategorii i 52 kategorii liściowych z 90 stałymi zapytaniami, gdzie żadna kategoria liściowa nie odpowiada jeden do jednego danym treningowym, Shieldstral uzyskał 91,3% F1. Jest to wynik nieco niższy niż GPT-OSS-Safeguard-20B (94,1%) i Nemotron-3.5-Safety-4B (91,8%), ale bez generowania śladu rozumowania. Wykrywanie odmów osiągnęło 91,5% ogólnie w porównaniu do 93,7% dla GPT-OSS-Safeguard-20B.

Model wykazuje słabsze strony w wielojęzycznej klasyfikacji promptów, zwłaszcza w języku arabskim i indonezyjskim, oraz w promptach RTP-LX (70,3% w porównaniu do 86,1% dla Nemotron-3.5-Safety-4B). Mistral odnotowuje również zmniejszoną niezawodność w przypadku wrogich lub zaciemnionych danych wejściowych oraz bardzo długich dokumentów. Wytrenowany kontekst obejmuje 32 tysiące tokenów w 12 językach.

Premiera Shieldstral 1.0 3B przez Mistral AI stanowi znaczący krok w kierunku bardziej elastycznych i wydajnych systemów moderacji treści. Możliwość dynamicznego definiowania polityk bezpieczeństwa w języku naturalnym, w połączeniu z imponującymi wynikami w zakresie bezpieczeństwa tekstu i multimodalnego, otwiera nowe perspektywy dla firm i twórców aplikacji, którzy potrzebują precyzyjnych i adaptacyjnych narzędzi do zarządzania treściami generowanymi przez użytkowników. To podejście może zrewolucjonizować sposób, w jaki platformy internetowe podchodzą do kwestii bezpieczeństwa, oferując jednocześnie większą kontrolę i niższe koszty operacyjne.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Mistral AI prezentuje Leanstral 1.5: Model agenta kodu dla Lean 4 rozwiązujący 587 problemów PutnamBench
OpenAI dyktuje warunki dostępu do AI, a to dopiero początek podziałów na rynku
Tencent Cloud udostępnia TencentDB Agent Memory v2.0 jako otwarte źródło: centrum pamięci dla agentów AI
Newsy

Tencent Cloud udostępnia TencentDB Agent Memory v2.0 jako otwarte źródło: centrum pamięci dla agentów AI

Tencent Cloud udostępniło TencentDB Agent Memory w wersji 2.0 jako otwarte źródło. To innowacyjne rozwiązanie ma służyć jako centrum pamięci na poziomie zespołowym dla agentów AI, usprawniając współpracę i zarządzanie ko

Redakcja Aigest11 godz. temu

Tydzień w AI: Ewolucja agentów i dylematy dostępności
Cloudflare wprowadza Kitesurf – przeglądarkę stworzoną dla agentów AI
Newsy

Cloudflare wprowadza Kitesurf – przeglądarkę stworzoną dla agentów AI

Cloudflare zaprezentowało Kitesurf, nową przeglądarkę internetową hostowaną w chmurze, zaprojektowaną specjalnie dla agentów sztucznej inteligencji. Ma ona umożliwić AI efektywniejsze nawigowanie po sieci i wykonywanie z

Redakcja Aigest17 godz. temu

Sztuczna inteligencja zaprojektowała od podstaw nowe wirusy zdolne do zabijania bakterii

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.