Shieldstral to otwarty model Mistral AI do moderacji tekstu i obrazów, udostępniony 4 sierpnia 2026 roku. Ma 3 mld parametrów, licencję Apache 2.0 i działa na jednej karcie GPU z 16 GB pamięci. Jest przeznaczony dla zespołów budujących czaty, platformy z treściami użytkowników i agentów AI. Model można pobrać bezpłatnie z Hugging Face.
Czym jest Shieldstral
Shieldstral to klasyfikator bezpieczeństwa, czyli model, który nie generuje odpowiedzi, lecz ocenia, czy treść narusza określoną zasadę. Mistral opublikował go 4 sierpnia 2026 roku jako model z otwartymi wagami. Obsługuje tekst, obrazy i ich połączenie.
Producent przeznacza go do moderacji promptów użytkowników, moderacji odpowiedzi modeli, oceny par pytanie-odpowiedź i wykrywania odmów. Karta modelu na Hugging Face wskazuje też zastosowania na urządzeniach brzegowych i sprzęcie o ograniczonych zasobach.
Jak działa moderacja w Shieldstral
Zamiast stałej listy kategorii zapisanej w wagach model przyjmuje zasady opisane zwykłym językiem w chwili zapytania. Mistral tłumaczy to tym, że różne aplikacje potrzebują różnych progów bezpieczeństwa. Serwis dla dzieci ma inne wymagania niż narzędzie dla analityków bezpieczeństwa.
Moderacja jest sformułowana jako pytanie tak lub nie. Zapytanie składa się z trzech części opisanych w karcie modelu:
- Instruct - kontekst i poziom rygoru, na przykład informacja, że treść zobaczy osoba niepełnoletnia.
- Query - pytanie o konkretne naruszenie sformułowane tak, by dało się na nie odpowiedzieć tak lub nie.
- Document - oceniana treść: tekst, obraz albo oba.
- Wynik - jeden token, z którego powstaje ciągła ocena ryzyka. Wartość powyżej 0,5 oznacza treść niebezpieczną.
Wymagania sprzętowe i licencja
Model mieści się w 16 GB pamięci GPU w precyzji BF16, więc nie wymaga klastra serwerów. Karta modelu zaleca uruchomienie przez vLLM w wersji 0.26.0 lub nowszej z biblioteką mistral_common 1.11.5 lub nowszą. Obsługiwane są też llama.cpp, SGLang i Transformers.
Licencja Apache 2.0 pozwala na użycie komercyjne i niekomercyjne. Model był trenowany na kontekście 32 tys. tokenów. Karta wspomina o teoretycznie dłuższym kontekście, ale zaleca pozostanie w zakresie treningowym.
Źródła różnią się w opisie wielkości. Komunikat i karta na Hugging Face mówią o 3 mld parametrów, a karta w dokumentacji Mistrala o 3,8 mld. Komunikat nie wspomina o dostępności Shieldstral przez płatne API, dlatego nie podajemy ceny.
Wyniki w testach
Mistral deklaruje, że w bezpieczeństwie tekstu Shieldstral dorównuje otwartym modelom ochronnym do siedmiu razy większym. Komunikat pokazuje to na wykresach, ale nie wymienia z nazwy modeli porównawczych. Liczby podaje karta na Hugging Face: F1 na poziomie 88,1 proc. na WildGuardTest dla promptów, 87,2 proc. na Aegis v2 dla odpowiedzi i 97,7 proc. na VLGuard dla treści multimodalnych.
To wyniki producenta na benchmarkach anglojęzycznych. Nie zastępują testu na własnych danych, zwłaszcza gdy aplikacja działa w innym języku.
Ograniczenia i niewiadome
Najpoważniejsze ograniczenie dla polskiego odbiorcy dotyczy języka. Karta modelu wymienia 12 obsługiwanych języków: angielski, francuski, hiszpański, niemiecki, włoski, portugalski, niderlandzki, chiński, japoński, koreański, arabski i rosyjski. Polskiego nie ma na tej liście, a sam Mistral wskazuje szerszą obsługę języków jako dalszą pracę.
- Nierówna skuteczność w różnych językach i dziedzinach, o której mówi karta modelu.
- Mniejsza niezawodność przy celowo zaciemnionych lub adwersaryjnych danych wejściowych.
- Słabsze wyniki przy długich dokumentach, wskazane jako kierunek dalszych prac.
- Brak informacji o wersji w API i jej cenie.
- Próg 0,5 jest domyślny. Dla konkretnej usługi trzeba go dobrać na własnych przykładach.
Shieldstral dla firm w Polsce
Dla polskiej firmy Shieldstral jest ciekawy przede wszystkim jako filtr uruchamiany we własnej infrastrukturze. Treści użytkowników nie muszą wtedy opuszczać serwerów firmy, co ułatwia kontrolę przetwarzania danych. Źródła nie odnoszą się jednak do RODO, więc ocenę zgodności trzeba przeprowadzić samodzielnie.
Przykład: sklep internetowy z Wrocławia moderuje opinie ze zdjęciami produktów. Obrazy może oceniać Shieldstral z polityką opisaną po angielsku, natomiast polskie opisy wymagają osobnego testu. W ocenie redakcji dailyAI przed wdrożeniem trzeba przygotować kilkaset polskich przykładów dozwolonych i niedozwolonych i sprawdzić na nich liczbę fałszywych alarmów.
Shieldstral pasuje do strategii Mistrala opartej na otwartych wagach i przetwarzaniu w Europie. Tę samą logikę widać w regionalnych endpointach API, które opisujemy w osobnym poradniku.
Źródła i data sprawdzenia
- Introducing ShieldstralMistral AI, publikacja: 2026-08-04, sprawdzono: 2026-09-26
- mistralai/Shieldstral-1.0 - model cardHugging Face, publikacja: 2026-08-04, sprawdzono: 2026-09-26
- Shieldstral 1.0 - model cardMistral AI Docs, publikacja: 2026-08-04, sprawdzono: 2026-09-26
Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.



