AI Новини

Mistral AI випускає Shieldstral 1.0 3B: політико-адаптивний мультимодальний класифікатор безпеки з відкритими вагами

Shieldstral 1.0 3B з відкритими вагами трактує модерацію як одне питання «так/ні» і повертає безперервний бал за один прогін. Працює локально на 16GB VRAM, має ліцензію Apache 2.0 та демонструє 84.9% F1 для тексту і 83.8% у мультимодальній безпеці.

2026-08-08 ·Hai Anton

Shieldstral 1.0 3B від Mistral AI — новий політико-адаптивний мультимодальний класифікатор безпеки з відкритими вагами. Він перетворює модерацію з жорсткої таксономії на одне «так/ні» питання і повертає калібрований бал за один прогін. Модель побудована на Ministral-3-3B-Base-2512 з візуальним енкодером Pixtral і ліцензується за Apache 2.0. Працює локально на одній GPU з 16GB VRAM у BF16, видає один токен та досягає 84.9% F1 для тексту і 83.8% у мультимодальній безпеці.

Що таке Shieldstral 1.0 3B і чому це важливо?

Це класифікатор безпеки з відкритими вагами, який підлаштовується під політику в момент інференсу. Він замінює фіксовані списки категорій на єдине питання «так/ні» і повертає неперервний бал. Завдяки цьому одна й та сама контрольна точка може поводитись по-різному, залежно від заданої політики.

Більшість guardrail-моделей «зашивають» категорії у ваги, тому зміну політики доводиться навчати заново. Shieldstral інвертує підхід: оператор формулює політику природною мовою як питання. Далі модель відповідає оцінкою безпеки за один forward pass, що знімає потребу в ретренінгу для нових контекстів.

Архітектурно рішення спирається на Ministral-3-3B-Base-2512 і має нативний візуальний енкодер Pixtral. Вихід — один токен, який кодує «так/ні» рішення, нормоване у безперервний бал. Така форма виходу спрощує порогування і знижує затримку та вартість.

За текстовою безпекою модель повідомляє середній F1 у 84.9%, що дорівнює GPT-OSS-Safeguard-20B. За мультимодальністю вона демонструє 83.8% і випереджає кожен базовий орієнтир, який Mistral оцінював. Хіба це не показник зрілої альтернативи важчим рішенням?

Чи готовий Shieldstral до продакшну і хто виграє від розгортання?

Так, і локально. Shieldstral-1.0-3B поміщається у 16GB VRAM у BF16, працює на одній GPU та ліцензується за Apache 2.0 для комерційного і некомерційного використання. Це знижує бар’єри входу для команд із жорсткими вимогами до розміщення.

Шляхи сервінгу вже доступні: рекомендовано vLLM (версія не нижче 0.26.0), llama.cpp через конвертацію в GGUF з квантуванням Q8_0, Q5_K_M або Q4_K_M, а також SGLang і Transformers. Підтримується донавчання через Axolotl. Класифікатор повертає один токен, тому затримка і вартість нижчі за reasoning-guard’и на кшталт GPT-OSS-Safeguard-20B.

За рівнем компаній, 16GB-футпринт робить модель досяжною для seed-команд, яким складно виправдати контракт на модерацію. Відкриті ліцензія і можливість самостійного хостингу пасують мідмаркету та ентерпрайзам із вимогами VPC або on‑prem для резиденції даних і аудиту. Для мультиорендних SaaS це окремий плюс: одна контрольна точка може забезпечувати різні політики на клієнта.

Напрями застосування охоплюють соціальні та UGC-платформи, ed-tech і дитячу безпеку, охорону здоров’я та ментальні додатки, фінтех і страхування, ігри та голосові чати, маркетплейси й модерацію реклами чи креативів, а також публічний сектор із вимогами суверенітету. Прикладами слугують модерація промптів і відповідей, класифікація відмов, перевірка зображення з підписом, відбір тренувальних і RAG-корпусів, гейтинг у агентних пайплайнах і per-tenant політики. Готові перейти від теорії до практики?

Як працює підхід «модерація як бінарне питання»?

Shieldstral зводить модерацію до одного «так/ні» питання, де політика живе в промпті. Фіксоване системне повідомлення задає задачу, а користувацьке містить три поля: , і . Далі модель обчислює безперервний бал із одного проходу.

Поле визначає контекст оцінки та суворість політики. Поле — це сама політика, сформульована як одне бінарне питання природною мовою. Поле подає матеріал до оцінки: промпт, відповідь, пару промпт–відповідь або зображення з опційним текстом.

Під час інференсу модель «розгортається» лише в бік токенів «yes» і «no». Значення проходять через softmax у безперервний бал, який порогується за τ=0.5. Таким чином класифікація промптів, модерація відповідей, виявлення відмов і токсичності зливаються в одну задачу.

Рекомендація Mistral — одна політика на виклик. Якщо потрібен широке рішення safe/unsafe, переліки категорій варто винести в , а в поставити одне широке питання. Чи не зручніше тримати політику гнучкою, ніж вбудованою у ваги?

Звідки береться адаптивність: рецепт даних і тренування

Перевага заявлена не від масштабу, а від даних: приблизно 54.1 млн зразків. Із них 45.2 млн — відкриті текстові, 4.4 млн — синтетичні контрастивні тексти, і 4.5 млн — мультимодальні. Саме ці корпуси навчають модель політиці, а не статичним ярликам.

Шар уніфікації на основі шаблонів перетворює кожен датасет у формат instruction–query–document. Для цього використовують процесори на рівні датасетів, рандомізовані формулювання і калібровану суворість. Строгі налаштування застосовують для джейлбрейків, м’якші — для даних про якість відповідей.

Найцікавіше — контрастивна генерація. LLM переписує безпечний текст у небезпечний варіант, що порушує цільову категорію, але не її «сусідню». Одна генерація створює позитив і «жорсткий» негатив поверх ідентичного змісту. Так модель вчиться тому, ЯК саме порушено політику, а не лише бінарному поділу.

Із зображеннями інакше: їх не синтезуєш, як текст. Тому додані загальні набори зображень як негативи, мутація запитів по 14-підкатегорній візуальній таксономії та фільтрація за візуально-мовним реренкером. Навчання — LoRA-файнтюн із подальшим трикратним злиттям: 0.6 public+generated, 0.3 public-only, 0.1 Ministral-3B-Instruct. Тренований контекст — 32k токенів у 12 мовах. Хочете знати, як це відбивається на метриках?

Які результати та де прогалини?

За текстовою безпекою Shieldstral повідомляє 84.9% середнього F1, зрівнявшись із GPT-OSS-Safeguard-20B. Є перемоги на ToxicChat (84.1), HarmBench (99.4) і Aegis v2 response (87.2). У мультимодальній безпеці модель має 83.8% проти 77.6% у OmniGuard-7B, лідирує на VLGuard (97.7) і UnsafeBench (81.8); LlavaGuard-7B все ще лідирує на власному бенчмарку з 81.4.

На бенчмарку адаптивності, побудованому на свідомо іншій таксономії (12 суперкласів, 26 підкатегорій і 52 листові категорії з 90 фіксованими запитами), де жодна листова категорія не має прямого мапінгу на тренування, Shieldstral набирає 91.3% F1. Це позаду GPT-OSS-Safeguard-20B (94.1%) і Nemotron-3.5-Safety-4B (91.8%), зате без генерації reasoning-трейсу. Виявлення відмов дає 91.5% проти 93.7% у GPT-OSS-Safeguard-20B.

Слабкі місця: багатомовна класифікація промптів відстає на арабській і індонезійській, а також на RTP-LX промптах (70.3 проти 86.1 у Nemotron-3.5-Safety-4B). Mistral також відзначає знижену надійність на адвесаріальних чи обфускованих вводах і дуже довгих документах. Це важливі обмеження для продакшн-пайплайнів.

Ключові пункти: 3B Apache 2.0 мультимодальний guardrail; політика — питання природною мовою під час інференсу, без ретренінгу. 84.9% текстового F1 зрівнявся з 20B; 83.8% мультимодального F1 — краще за оцінені базові рішення. 54.1 млн зразків із sibling-contrastive переписами — механізм узагальнення політики. Один forward pass, один вихідний токен, неперервний бал при τ=0.5 — достатньо дешево для real‑time гейтингу. Слабкості: мови з низькими ресурсами, обфусковані вводи, довгі документи.

На основі матеріалу MarkTechPost.

Готові автоматизувати свій магазин?

Ми проаналізуємо ваші процеси, знайдемо вузькі місця та запропонуємо конкретний план автоматизації. Перша консультація — безкоштовна.

Написати в Telegram →
Гай Антон
Гай Антон

Засновник HAIQ — AI Automation Agency. Засновник HAIQ. Будую автоматизації та AI-рішення для українського e-commerce на базі n8n. Пишу про автоматизацію, чат-ботів та AI для бізнесу.