Mistral hat mit Shieldstral ein neues Open-Weight-Modell mit nur 3 Milliarden Parametern veröffentlicht, das KI-Eingaben und -Ausgaben auf Sicherheitsverstöße überprüft. Das Besondere: Das Modell ersetzt starre Kategorien durch natürlichsprachliche Ja/Nein-Fragen und lässt Betreiber Prüfkriterien zur Laufzeit selbst definieren. Damit vermeiden sie die Abhängigkeit von vordefinierten Kategoriensystemen anderer Anbieter. In Benchmarks erreicht Shieldstral vergleichbare oder bessere Ergebnisse als deutlich größere Safety-Klassifikatoren und kann lokal betrieben werden.