4 августа 2026 года компания Mistral AI выпустила проект Shieldstral — многомодальный безопасный классификатор уровня 3B. Модель предназначена для проверки текста, изображений и смешанного текстово‑графического контента через единый интерфейс. В отличие от традиционных моделей, Shieldstral позволяет настраивать правила проверки через естественный язык на этапе вывода — это даёт возможность адаптировать стандарты под разные сценарии без переобучения классификатора.
Архитектура Shieldstral состоит из трёх этапов:
* унификация задач проверки в формат вопросов с ответом «да/нет»;
* обучение модели через сравнительное обучение для сопоставления правил;
* интеграция понимания текста, изображений и адаптации правил в одном легковесном модели.
Формула проверки включает три настраиваемых поля:
* <<<Instruct>>> — определяет сценарий проверки и критерии оценки;
* <<<Query>>> — формулирует вопрос для проверки;
* <<<Document>>> — содержит проверяемый контент (текст, изображение или смешанный контент).
Модель выдаёт вероятность в виде двух токенов. После нормализации получается значение от 0 до 1. С учётом бизнес‑порога оно определяет: пропустить контент, заблокировать или отправить на ручную проверку.
Например, если в <<<Instruct>>> задано правило для новостных платформ: блокировать только прямые изображения травм и крови, а репортажи о войне не ограничивать, то в <<<Query>>> можно задать вопрос: «Содержит ли контент элементы насилия, требующие блокировки?» Если в <<<Document>>> контент описывает только вооружение, модель выдаст «no». Если в материале есть детали травм и крови — «yes».
Shieldstral изменил подход к построению обучающих данных. Вместо простых ответов «Yes/No» модель обучают определять соответствие контента правилам. Используется контрастное обучение: при неизменном контенте меняются вопросы, и модель должна давать разные ответы в зависимости от правил. Например, на вопрос «Содержится ли незаконное задержание?» модель отвечает «yes», а на вопросы «Содержит ли текст ненависть по расовому признаку?» или «Описывает ли метод изготовления оружия?» — «no».
Для усиления способности модели различать близкие правила в обучающие данные включают образцы с похожим смыслом, но из разных категорий (например, незаконное задержание, телесные повреждения, угрозы и домогательства относятся к категории «насилие», но представляют разные типы поведения). Создана система классификации с 11 верхними категориями и 73 листовыми категориями. Сгенерировано около 4,4 млн синтетических контрастных текстовых образцов.
По данным из официальной статьи Shieldstral, при использовании только открытых данных безопасности F1 составляет 61,1 %. После добавления синтетических контрастных данных показатель вырастает до 84,4 % (рост на 23,3 процентных пункта).
Одна из проблем при контроле визуального контента — дефицит образцов с нарушениями, высокая стоимость ручной разметки, невозможность массового создания запрещённого контента для изображений так же легко, как для текста. Shieldstral решает эти задачи: включает изображения и текстово‑изобразительные материалы в обучение с точным соответствием «правило — контент», увеличивает разнообразие изображений для компенсации нехватки образцов с нарушениями. Команда Shieldstral сосредоточилась не на модификации изображений, а на увеличении разнообразия вопросов для проверки. Сгенерировано около 2000 различных формулировок вопросов по категориям визуальных рисков (насилие, ненависть, незаконный контент). Около 30 % вопросов сформулированы в отрицательной форме (например, «») для снижения зависимости модели от фиксированных фраз и ключевых слов.
Рейфэн использует три типа изображений: нарушающие правила, чистые и данные для классификации изображений и обнаружения объектов. Нарушающие правила изображения дают положительные примеры, чистые и общие данные — отрицательные. Для различения схожих визуальных рисков создаются сложные отрицательные примеры (например, изображение с ожесточённым спором без явных телесных повреждений).
Shieldstral использует модель перестановки визуального языка для проверки каждой пары «изображение — вопрос по правилу». Это позволяет фильтровать ошибочные метки, несоответствия между изображением и текстом и ненадёжные образцы. Всего Shieldstral создала около 450 млн многомодальных обучающих образцов.
Результаты оценок безопасности демонстрируют высокую эффективность модели:
* HarmBench — F1 = 99,4 % (превосходит GPT‑OSS‑Safeguard‑20B, LlamaGuard‑4‑12B);
* WildGuardTest — F1 = 88,1 % (сопоставим с GPT‑OSS‑Safeguard‑20B);
* XSTest — F1 = 94,6 %;
* VLGuard — F1 = 97,7 % (лидирует среди моделей с большим количеством параметров, таких как OmniGuard‑7B, LlavaGuard‑7B);
* UnsafeBench — F1 = 81,8 % (превосходит вторую модель почти на 10 процентных пунктов).
Shieldstral выполняет сложную для стандартизации задачу — понимание текущего правила и определение соответствия проверяемого контента этому правилу. Модель использует единый логический подход для текста, изображений и их комбинаций. При изменении правил не требует немедленного внесения изменений в параметры модели. При этом Shieldstral — модель для лёгкого правило‑основанного суждения, она не отвечает за полный процесс управления контентом. Интерпретация оценки риска, установка пороговых значений и решение о пропуске, блокировке или ручной проверке остаются за бизнес‑системой.
Shieldstral демонстрирует потенциал в вертикальных сценариях. Это малопараметрическая специализированная модель с гибким подходом, способная конкурировать с большими моделями по детализации и мультимодальной оценке безопасности. Подробнее можно узнать по ссылкам