AI Новини

Decision AI‑моделі: Jev, конкуренти та реальні результати без зайвих токенів

Decision AI‑моделі повертають рішення з ймовірностями, а не текст. Розбираємо Jev, бенчмарки, ціни, кейси застосування, конкурентів і критерії вибору.

2026-10-03 ·Hai Anton

Decision AI‑моделі роблять не тексти, а вибір. Ви надсилаєте стан і типізовані запитання, а у відповідь отримуєте варіанти, бали або ймовірності, на яких код одразу розгалужується. Категорія стала мейнстрімом після релізу Jev від TypeSafe AI, який два роки розвивали в stealth і назвали “System One” на честь швидкого мислення Канемана. За три тижні з’явилися конкуренти й open‑source відтворення. Розбираємо принцип роботи, показники, ціни, кейси та вибір моделей.

Що таке Decision AI‑моделі і чому про них заговорили?

Це моделі, які повертають рішення, а не абзац тексту. Ви ставите типізовані запитання, а отримуєте Choice, Score або ймовірність Yes/No, з якою код продовжує гілку.

Категорія стала помітною після запуску Jev від TypeSafe AI. Компанія розробляла його два роки в stealth і позиціонує як “System One” модель — відсилання до швидкого, інтуїтивного System 1 мислення за Канеманом. Після релізу ринок закипів.

Вже за три тижні Fastino Labs вивела два конкуруючі рішення. Паралельно спільнота опублікувала кілька відтворень у стилі Jev з відкритими вагами. Так з’явився окремий клас рішень із власною екосистемою.

Суть проста: якщо системі потрібна обмежена відповідь для гілкування, Decision‑модель доречна. Якщо відповідь має читати людина, беріть LLM. Далі — як працює Jev, які є метрики, ціни й практичні кейси.

То що важливіше саме для вас — швидкість, вартість чи екосистема? Це питання допоможе обрати перший пілот.

Як працює Jev і скільки це коштує?

Jev приймає “стан” і один або кілька запитів. Він підтримує три примітиви: Choice, Score і Noul, а всі запитання обчислює паралельно й ізольовано.

За документами TypeSafe, Choice обирає один варіант зі списку з ймовірностями та впевненістю. Jev підтримує до 255 опцій. Score оцінює стан за впорядкованою рубрикою, теж з імовірностями та впевненістю. Noul — це ймовірність від 0 до 1, що твердження істинне.

Кожне запитання рахується незалежно на тому самому стані. Додавання нових запитань майже не впливає на час відповіді. Jev не генерує рядки, тож, за словами TypeSafe, типова помилка повернення “не того типу” виключена.

Під капотом TypeSafe описує нову архітектуру, паралельний семплер і тренування Reinforcement Learning for Calibrated Decisions (RLCD). Якщо RLHF оптимізує переваги людини, то RLCD — калібровані ймовірності, де вища впевненість має означати вищу точність.

Ключовий момент — ціна. Jev коштує $0.042 за мільйон вхідних токенів, а вихід безкоштовний. OpenRouter вказує контекстне вікно 32K. TypeSafe повідомляє час відповіді від 70 до 500 мс, кінець у кінець.

Що кажуть бенчмарки TypeSafe?

У власних workflow‑оцінках Jev зрівнявся за точністю з Sonnet 5, але в рази дешевше й швидше. Водночас він відстає від найкращої конфігурації на 6.3 пункти.

TypeSafe побудувала оцінки для чотирьох завдань: інциденти безпеки, спостережність трас агентів, обробка інвойсів і клієнтська підтримка. Референсні лейбли — середнє між GPT‑6 Astra та Claude Fable 5.1 на високому рівні мислення.

Результати такі: Jev — 67.8% середньої точності, $0.0004 за кейс і 0.4 секунди. У тій же схемі Claude Sonnet 5 дав 67.8%, але $0.1174 за кейс і 78.1 секунди. Найкраща порівняльна модель (OpenAI “sol”) показала 74.1%, $0.0836 і 23.3 секунди.

Помесячно по задачах картина змішана: Jev набрав 76.0% у підтримці клієнтів, але лише 61.8% в обробці інвойсів. Висновок простий: ціна й латентність виграють, точність — контекстозалежна.

Ці числа походять з workflow‑оцінок TypeSafe і відображають саме цю методику.

Де Decision‑моделі вже корисні, а де — ні?

Правило таке: якщо коду потрібна обмежена відповідь для гілкування, беріть Decision‑модель. Якщо відповідь читатиме людина — беріть LLM.

Керування агентами — природний фіт. Обирайте наступний інструмент або субагента, вирішуйте “продовжити, повторити, запитати користувача чи зупинити” одним Choice. Роутіть запити: прості — на дешеву модель, складні — на фронтир. Fastino описує роутинг за напрямом, складністю або рівнем ескалації.

Класифікація й тріаж — ще один великий блок. Роутинг тікетів, e‑mail‑тріаж і виявлення наміру становлять значну частину 17‑датасетного бенчмарку Fastino. Саймон Віллісон відзначає спам‑детект, підказки лейблів і пріоритизацію як природні випадки. У безпеці простий воркфлоу TypeSafe вирішує — закрити алерт, передати аналітику чи ізолювати.

Перевірка й безпека теж виграють. Jev можна ставити на скоринг підказок, трейсів і виходів як гардерейли та джейлбрейк‑детект. GLiNER2.5‑Decide декодує “безпека” і “тип шкоди” разом, щоб відповіді не суперечили одна одній. OpenRouter описує перевірені каскади: дешево драфтити, перевіряти Jev, ескалювати лише на фейлах.

Оцінювання й спостережність рухаються в той самий бік. Arize і Langfuse запускають Jev‑оцінювачів на трейси. У CI/CD Buddy дає діяти з Jev для скорингу, класифікації або гейтів. У пошуку й даних можна реренкувати 100 BM25‑кандидатів у паралельному виклику, робити map‑reduce на великих масивах і обрізати контекст до LLM.

Реальний час — ще одна ніша. TypeSafe продемонструвала Jev у Doom і Wikiracing. Субсекундні рішення роблять UX реактивним. У грі команда тримала близько 10 запитів за секунду, оцінивши вартість приблизно у $7 за годину.

А де не варто? Коли потрібен згенерований текст, резюме або пояснення. Коли завдання вимагає точної арифметики, підрахунку або дат. Гайд TypeSafe з “зазубреностей” Jev 1.13 відзначає всі три. І коли рішення впливають на добробут людей, наприклад, найм. Віллісон попереджає: приховану упередженість складно інспектувати.

Хто конкурує і як обрати модель сьогодні?

На ринку вже кілька помітних лінійок. Jev 1.13 від TypeSafe — закритий API з $0.042 за мільйон вхідних токенів, вихід безкоштовний, нова архітектура, паралельний семплер і RLCD, до 255 опцій у Choice, 70–500 мс. GLiDE від Fastino — закритий API з 40K контекстом і “адаптивним мисленням” на невизначених кейсах, повертає обрану дію, впевненість і розподіли.

GLiNER2.5‑Decide має відкриті ваги під Apache 2.0. Це 340M DeBERTa‑v3‑large енкодер з типізованими рішеннями та спільними обмеженнями, додатково витягує спани і відношення. На V100 це 38.3 мс p50, на 48‑vCPU CPU — 167.3 мс, працює локально. Laya від Convai — також Apache 2.0, 421M ModernBERT‑large (англ.) або 322M mmBERT‑base (мультимовний), підтримує Choice, Score, Noul у 100+ мовах, близько 33 мс за питання на GPU, теж локально.

Є й відтворення на Qwen. JevK5 — 4B на Qwen3.5‑4B з merged LoRA, віддає ймовірність для кожної опції за один прохід, працює на GPU локально. OpenJev (MIT) читає логіти опцій на замороженому Qwen3.5‑4B і у 5.21 раз швидший за авторегресивний JSON. kev‑0.5b — LoRA плюс readout head на Qwen2.5‑0.5B з Jev‑сумісним API, Noul і Choice 2–255, Score, орієнтовно ~160 мс для 6 запитань на Apple M5, запускається на ноуті.

Числа head‑to‑head походять із різних наборів і не зводяться в єдину таблицю. GLiDE має 64.81 на Decision Index 0.2.1; у CLadder — GLiDE 88.7%, Jev 72.6%; у CRUXEval — GLiDE 92.6%, Jev 73.0%. На Fast Decisions (17 датасетів) GLiNER2.5‑Decide — 60.1%, JevK5 — 57.5%, SemIf — 56.4%, GLiFormer — 49.0%, Laya — 46.6%. На 102‑рядковому сабсеті Eval TypeSafe — Jev 0.883, OpenJev 0.845 balanced accuracy.

Є дві важливі ремарки. Fastino обирала і тести, і суперників для заяв про GLiDE і GLiNER2.5‑Decide. У порівнянні Fast Decisions використано JevK5 як відтворення, а не оригінальний Jev від TypeSafe. Тому перевіряйте все на власних даних.

Як обирати? Візьміть Jev, якщо потрібен керований API й найширша підтримка в екосистемі вже сьогодні. Оберіть GLiDE, якщо хочете тестувати складні, reasoning‑важкі рішення. Оберіть GLiNER2.5‑Decide для air‑gapped розгортань, тонкого донавчання або коли відповіді мають підкорятися крос‑питальним правилам. Візьміть Laya для мультимовних рішень або дуже низької латентності на питання. А kev, OpenJev чи JevK5 підійдуть для локальних експериментів і уникнення vendor lock‑in.

Чому тренд саме зараз? Ідея не нова: класифікатори й реренкери давно ухвалюють рішення. Decision Transformer (2021) представив RL як секвенс‑моделювання. У 2022 DeepMind Gato показав “генераліста” на багатьох задачах. У 2023 огляд уже називав “великі decision‑моделі” наступним кроком. У 2026 усе вирішила упаковка: агентам потрібні дешеві судження, калібрування відкриває автоматизацію, екосистема рушила швидко (Vercel, OpenRouter, Arize, Langfuse, Buddy), а конкуренти вийшли миттєво — Fastino показала GLiNER2.5‑Decide 24 вересня і GLiDE 30 вересня, паралельно з’явилися kev, OpenJev і JevK5.

На основі матеріалу наданого в брифі.

Готові автоматизувати свій магазин?

Ми проаналізуємо ваші процеси, знайдемо вузькі місця та запропонуємо конкретний план автоматизації. Перша консультація — безкоштовна.

Написати в Telegram →
Гай Антон
Гай Антон

Засновник HAIQ — AI Automation Agency. Засновник HAIQ. Будую автоматизації та AI-рішення для українського e-commerce на базі n8n. Пишу про автоматизацію, чат-ботів та AI для бізнесу.