Mistral hat Shieldstral veröffentlicht, ein Open-Weight-Modell zur Bewertung der Sicherheit von Texten und Bildern. Anders als herkömmliche Schutzsysteme arbeitet Shieldstral nicht mit festgelegten Kategorien für schädliche und unzulässige Inhalte. Stattdessen lässt sich eine Sicherheitsregel als einfache Ja-oder-Nein-Frage formulieren. Die Fragen lassen sich flexibel anpassen, gleichzeitig kann der Kontext der Inhalte besser berücksichtigt werden.
Dasselbe Modell kann somit an unterschiedliche Richtlinien angeglichen werden, ohne es neu trainieren zu müssen. Mistral berichtet, dass Shieldstral die gleiche Sicherheitsleistung wie deutliche größere Modelle erreicht. Das Modell verfügt über 3 Milliarden Parameter und ist als Apache-2.0-Lizenz auf Hugging Face zum Download verfügbar.