Shieldstral 1.0 3B від Mistral AI — новий політико-адаптивний мультимодальний класифікатор безпеки з відкритими вагами. Він перетворює модерацію з жорсткої таксономії на одне «так/ні» питання і повертає калібрований бал за один прогін. Модель побудована на Ministral-3-3B-Base-2512 з візуальним енкодером Pixtral і ліцензується за Apache 2.0. Працює локально на одній GPU з 16GB VRAM у BF16, видає один токен та досягає 84.9% F1 для тексту і 83.8% у мультимодальній безпеці.
Що таке Shieldstral 1.0 3B і чому це важливо?
Це класифікатор безпеки з відкритими вагами, який підлаштовується під політику в момент інференсу. Він замінює фіксовані списки категорій на єдине питання «так/ні» і повертає неперервний бал. Завдяки цьому одна й та сама контрольна точка може поводитись по-різному, залежно від заданої політики.
Більшість guardrail-моделей «зашивають» категорії у ваги, тому зміну політики доводиться навчати заново. Shieldstral інвертує підхід: оператор формулює політику природною мовою як питання. Далі модель відповідає оцінкою безпеки за один forward pass, що знімає потребу в ретренінгу для нових контекстів.
Архітектурно рішення спирається на Ministral-3-3B-Base-2512 і має нативний візуальний енкодер Pixtral. Вихід — один токен, який кодує «так/ні» рішення, нормоване у безперервний бал. Така форма виходу спрощує порогування і знижує затримку та вартість.
За текстовою безпекою модель повідомляє середній F1 у 84.9%, що дорівнює GPT-OSS-Safeguard-20B. За мультимодальністю вона демонструє 83.8% і випереджає кожен базовий орієнтир, який Mistral оцінював. Хіба це не показник зрілої альтернативи важчим рішенням?
Чи готовий Shieldstral до продакшну і хто виграє від розгортання?
Так, і локально. Shieldstral-1.0-3B поміщається у 16GB VRAM у BF16, працює на одній GPU та ліцензується за Apache 2.0 для комерційного і некомерційного використання. Це знижує бар’єри входу для команд із жорсткими вимогами до розміщення.
Шляхи сервінгу вже доступні: рекомендовано vLLM (версія не нижче 0.26.0), llama.cpp через конвертацію в GGUF з квантуванням Q8_0, Q5_K_M або Q4_K_M, а також SGLang і Transformers. Підтримується донавчання через Axolotl. Класифікатор повертає один токен, тому затримка і вартість нижчі за reasoning-guard’и на кшталт GPT-OSS-Safeguard-20B.
За рівнем компаній, 16GB-футпринт робить модель досяжною для seed-команд, яким складно виправдати контракт на модерацію. Відкриті ліцензія і можливість самостійного хостингу пасують мідмаркету та ентерпрайзам із вимогами VPC або on‑prem для резиденції даних і аудиту. Для мультиорендних SaaS це окремий плюс: одна контрольна точка може забезпечувати різні політики на клієнта.
Напрями застосування охоплюють соціальні та UGC-платформи, ed-tech і дитячу безпеку, охорону здоров’я та ментальні додатки, фінтех і страхування, ігри та голосові чати, маркетплейси й модерацію реклами чи креативів, а також публічний сектор із вимогами суверенітету. Прикладами слугують модерація промптів і відповідей, класифікація відмов, перевірка зображення з підписом, відбір тренувальних і RAG-корпусів, гейтинг у агентних пайплайнах і per-tenant політики. Готові перейти від теорії до практики?
Як працює підхід «модерація як бінарне питання»?
Shieldstral зводить модерацію до одного «так/ні» питання, де політика живе в промпті. Фіксоване системне повідомлення задає задачу, а користувацьке містить три поля:
Поле
Під час інференсу модель «розгортається» лише в бік токенів «yes» і «no». Значення проходять через softmax у безперервний бал, який порогується за τ=0.5. Таким чином класифікація промптів, модерація відповідей, виявлення відмов і токсичності зливаються в одну задачу.
Рекомендація Mistral — одна політика на виклик. Якщо потрібен широке рішення safe/unsafe, переліки категорій варто винести в
Звідки береться адаптивність: рецепт даних і тренування
Перевага заявлена не від масштабу, а від даних: приблизно 54.1 млн зразків. Із них 45.2 млн — відкриті текстові, 4.4 млн — синтетичні контрастивні тексти, і 4.5 млн — мультимодальні. Саме ці корпуси навчають модель політиці, а не статичним ярликам.
Шар уніфікації на основі шаблонів перетворює кожен датасет у формат instruction–query–document. Для цього використовують процесори на рівні датасетів, рандомізовані формулювання і калібровану суворість. Строгі налаштування застосовують для джейлбрейків, м’якші — для даних про якість відповідей.
Найцікавіше — контрастивна генерація. LLM переписує безпечний текст у небезпечний варіант, що порушує цільову категорію, але не її «сусідню». Одна генерація створює позитив і «жорсткий» негатив поверх ідентичного змісту. Так модель вчиться тому, ЯК саме порушено політику, а не лише бінарному поділу.
Із зображеннями інакше: їх не синтезуєш, як текст. Тому додані загальні набори зображень як негативи, мутація запитів по 14-підкатегорній візуальній таксономії та фільтрація за візуально-мовним реренкером. Навчання — LoRA-файнтюн із подальшим трикратним злиттям: 0.6 public+generated, 0.3 public-only, 0.1 Ministral-3B-Instruct. Тренований контекст — 32k токенів у 12 мовах. Хочете знати, як це відбивається на метриках?
Які результати та де прогалини?
За текстовою безпекою Shieldstral повідомляє 84.9% середнього F1, зрівнявшись із GPT-OSS-Safeguard-20B. Є перемоги на ToxicChat (84.1), HarmBench (99.4) і Aegis v2 response (87.2). У мультимодальній безпеці модель має 83.8% проти 77.6% у OmniGuard-7B, лідирує на VLGuard (97.7) і UnsafeBench (81.8); LlavaGuard-7B все ще лідирує на власному бенчмарку з 81.4.
На бенчмарку адаптивності, побудованому на свідомо іншій таксономії (12 суперкласів, 26 підкатегорій і 52 листові категорії з 90 фіксованими запитами), де жодна листова категорія не має прямого мапінгу на тренування, Shieldstral набирає 91.3% F1. Це позаду GPT-OSS-Safeguard-20B (94.1%) і Nemotron-3.5-Safety-4B (91.8%), зате без генерації reasoning-трейсу. Виявлення відмов дає 91.5% проти 93.7% у GPT-OSS-Safeguard-20B.
Слабкі місця: багатомовна класифікація промптів відстає на арабській і індонезійській, а також на RTP-LX промптах (70.3 проти 86.1 у Nemotron-3.5-Safety-4B). Mistral також відзначає знижену надійність на адвесаріальних чи обфускованих вводах і дуже довгих документах. Це важливі обмеження для продакшн-пайплайнів.
Ключові пункти: 3B Apache 2.0 мультимодальний guardrail; політика — питання природною мовою під час інференсу, без ретренінгу. 84.9% текстового F1 зрівнявся з 20B; 83.8% мультимодального F1 — краще за оцінені базові рішення. 54.1 млн зразків із sibling-contrastive переписами — механізм узагальнення політики. Один forward pass, один вихідний токен, неперервний бал при τ=0.5 — достатньо дешево для real‑time гейтингу. Слабкості: мови з низькими ресурсами, обфусковані вводи, довгі документи.
На основі матеріалу MarkTechPost.