06.08.2026
Мультимодальный классификатор проверяет текст и изображения по правилам, которые задаются на естественном языке непосредственно при запуске, без переобучения. В тестах разработчиков Shieldstral сопоставима с моделями почти в семь раз крупнее; веса опубликованы по лицензии Apache 2.0.
Французская компания Mistral AI представила Shieldstral — мультимодальный классификатор безопасности на 3 млрд параметров. Он предназначен для проверки пользовательских запросов, ответов ИИ, изображений и комбинаций текста с изображениями.
Вместо фиксированного набора категорий оператор задаёт критерий модерации в форме вопроса на естественном языке. Модель оценивает вероятности ответов «да» и «нет» и преобразует их в показатель безопасности, поэтому правила можно менять во время работы без дополнительного обучения.
Согласно техническому отчёту, среднее значение метрики F1 составило 84,9% на текстовых тестах и 83,8% на мультимодальных. Разработчики утверждают, что Shieldstral сравнялась или превзошла некоторые модели почти в семь раз крупнее. Модель запускается на одной видеокарте NVIDIA с 16 Гбайт памяти, а её веса доступны на Hugging Face по лицензии Apache 2.0.
Источник: mistral.ai