Harvey представив Harvey Tenet — перший пост‑тренований чекпойнт компанії для довготривалої юридичної роботи. Базою став Kimi K3, а пост‑тренування виконали разом із Fireworks через асинхронне підкріплювальне навчання. Корпус поєднав синтетичні набори, відкриті юридичні дані та внесок людських експертів; клієнтські дані не використовувалися. У порівнянні з базовим K3, Tenet завершує майже вдвічі більше відкладених завдань на LAB і на 20% більше на LAB: Contracts. Додайте сюди перенесення приростів на зовнішні бенчмарки — і ви бачите окреслену мету: правовий інтелект на open‑weight моделях і шлях фірмам до власних спеціалізованих моделей.
Що таке Harvey Tenet і навіщо він потрібен?
Harvey Tenet — це пост‑тренований чекпойнт Kimi K3, сфокусований на довгих юридичних процесах. Його навчили асинхронним RL спільно з Fireworks, використавши задачі з тривалою агентною взаємодією. Мета подвійна: збудувати фронтирний правовий інтелект на open‑weight основі та дати юридичним фірмам можливість володіти власними спеціалізованими моделями.
Корпус тренування змішав три джерела: синтетичні приклади, публічно доступні юридичні дані та матеріали від людських експертів. Компанія окремо підкреслює, що жодні дані клієнтів не використовувалися. Ця межа важлива для довіри та відповідності процесів.
Tenet націлений на «довгі горизонти» — завдання, де агент проходить сотні або тисячі кроків. Такі сценарії типовi для due diligence, аналізу контрактів і пошуку прецедентів. Стратегія робить акцент на керованих траєкторіях, чітких критеріях і узгоджених суддях‑LLM.
Результат — суттєві прирости проти базового K3 на внутрішніх бенчмарках Harvey. На LAB Tenet виконує майже вдвічі більше відкладених задач. На LAB: Contracts — на 20% більше, з підвищенням all‑pass показника на 9 та 2 пункти відповідно.
Крім цього, прирости переносяться на зовнішні стенди без спеціального донавчання. Модель показує покращення на APEX Agents і Redline Bench, залишаючи стабільні результати на знаннєвих тестах. Це сигналізує про навчання поведінці, а не підгонку під метрики.
Чи готовий Tenet до продакшен‑розгортання сьогодні?
Поки ні. Harvey Tenet — це дослідницький прев’ю, оголошений 20 серпня 2026 року. Ваги, модельна картка та API недоступні. Сам K3 відкритий за вагами, але Tenet — приватний чекпойнт Harvey. Компанія каже, що робота поступово перейде «від дослідження до продакшену» в її продуктах.
Фактично, сьогодні реліз — це рецепт, а не артефакт. Команда публікує підхід: як будувати агентні середовища, як формувати винагороди, і як утримувати узгодженість великого MoE між навчанням та інференсом. Це дозволяє різним лабораторіям спробувати відтворити методику.
“What ships today is the recipe, not the artifact.”
Доступний рівень — Enterprise. Використання йде через платформу Harvey, яку продають юридичним фірмам, середнім компаніям і внутрішнім юрдепартаментам. Лабораторія з RL‑стеком може відтворити метод; тренування зайняло близько двох місяців на приблизно 150 NVIDIA B300 GPU.
Де це актуально? Для юридичних сервісів, корпоративних юрдепартаментів, приватного капіталу та інвестбанкінгу (M&A diligence). Також для регульованих секторів із великими масивами контрактів: страхування, фінансові послуги, охорона здоров’я, енергетика. Приклади застосувань — меморандум M&A due diligence по датаруму, драфтинг, рев’ю і редлайнинг контрактів, структурований екстракт до 10 000 документів, пошук прецедентів у знаннях фірми.
Що показують цифри і як це впливає на вартість?
Проти базового K3, Tenet завершує майже вдвічі більше відкладених завдань на Harvey Legal Agent Benchmark. На LAB: Contracts — на 20% більше, з підйомом all‑pass на 9 та 2 процентні пункти відповідно. Harvey також повідомляє state‑of‑the‑art на LAB: Contracts і друге місце на LAB, використовуючи бали базових моделей від Vals.
Найцікавіший результат — переносимість. Tenet суттєво покращується на Mercor’s APEX Agents (корпоративне право) і Crosby’s Redline Bench. Жоден із цих стендів не бачився під час тренування. Одночасно модель утримує рівень на LegalBench, CUAD, MAUD і Scale’s PRBench. Агентне тренування не зруйнувало «підручникову» юридичну логіку.
Вартість і якість оптимізовані разом, а не обміняні одна на одну. Відкриті ваги знижують ціну за токен. Формування винагород, що віддає перевагу коротшим траєкторіям за однакової якості, зменшує витрати токенів.
Harvey зазначає значні прирости якості при стабільній вартості. Це важливо для фірм із великими датасетами контрактів і жорсткими бюджетами. Менше токенів за епізод — це менше рахунків за інференс.
Чи не з’являється ризик «переадаптації» під стенди? Дані з APEX і Redline свідчать про зворотне. Поведінкові стратегії переносяться, а знаннєві метрики не просідають. Це сильна ознака справжнього навчання агентності.
Як саме навчали Tenet і підтримували узгодженість?
Тренування виконували асинхронним RL у «пісочницях», змодельованих під LAB‑завдання. Кожен епізод має інструкцію у стилі партнера приблизно на 50 слів, клієнтський набір ключових і периферійних документів, та експертну рубрику атомарних критеріїв «залік/незалік». На типовій задачі близько 50 критеріїв, у крайніх — сотні.
Один rollout може перевищувати 1 000 кроків. Такі довгі траєкторії ставлять вимоги до пам’яті та стабільності політики. Тому оцінювання автоматизовано: суддя‑LLM виставляє бали за рубрикою, а абляції зупинилися на Kimi 2.6 як на судді.
Нагорода комбінує три сигнали: частку задоволених критеріїв рубрики, цілісний підрахунок розв’язаних юридичних питань і бонус за «all‑pass». Політику оптимізують GSPO, використовуючи rank‑64 LoRA поверх усього K3‑мережевого графа.
Кожен крок оптимізатора бачить вісім груп задач по вісім rollout‑ів. Навчання йде приблизно по 1 750 середовищах і понад 10 000 rollout‑ів за епоху. Це дозволяє моделі збирати статистику на широкому спектрі кейсів.
Fireworks співбудували тренер і розгортання rollout‑ів на рівні ядра. Задіяні підходи token‑in‑token‑out і router replay, щоб утримувати велику MoE чисельно вирівняною між тренуванням та інференсом. Узгодженість зменшує «розсинхрон» поведінки між фазами.
Які спеціалізовані можливості тренували окремо?
Команда Harvey також пост‑тренувала спеціалістів, до яких Tenet може маршрутизуватися як до інструментів або суб‑агентів. Мета — розширити покриття важких підзадач, не перевантажуючи базовий чекпойнт.
M&A diligence. На LAB: Diligence один таск може проходити до 80 млн токенів. Жодний базовий підхід не перевищив 43,8% за критеріями. Разом із Baseten Harvey перейшли до зв’язки Recursive Language Model: кореневий агент тримає датарум у REPL і делегує суб‑агентам. Оркестратор GLM‑5.2 сам по собі досяг 46,1%; пост‑тренування у цій зв’язці через self‑distillation підняло результат до 60,1%.
Review Table. З Applied Compute пост‑тренований GLM‑5.2 підвищив якість відповідей на 3,6 пункти та якість цитувань на 12,1 пункту при приблизно одній десятій вартості за клітинку. Модель навчилася утримуватися від відповіді, коли питання не застосовується.
Знання фірми. З Engram модель Qwen3.8‑27B вивчає приблизно 100 млн токенів із клієнтських справ і стискає їх у 1 млн токенів структурованих знань плюс параметричну пам’ять. Рівень проходження критеріїв виріс більш ніж на 15%, токени в завершених траєкторіях знизилися на 58%, а вартість запиту впала приблизно на 90% — 190,8 «інтелекту‑на‑токен» проти 129,3 для найкращої фронтирної конфігурації.
Сукупно найбільші дельти виникли саме у стеку спеціалістів: RLM‑diligence, Review Table та пам’ять фірми. Tenet може викликати ці інструменти як суб‑агентів, отримуючи прирости там, де це найболючіше для процесів.
Чи означає це, що базовий чекпойнт менш важливий? Ні. Він тримає загальну агентність і правову логіку, тоді як спеціалісти закривають вузькі «довгі хвости». Разом це створює гнучкий, але контрольований робочий стек.
На основі матеріалу оригінальний матеріал.