SkillOpt — це текстовий оптимізатор від команди Microsoft і партнерських університетів, що навчає один документ природною мовою, а цільова модель залишається замороженою. Оптимізатор читає прогони зі скором і пропонує обмежені правки: додати, видалити, замінити. Розділена вибірка приймає правку лише за строгого покращення. Експортований артефакт — один файл best_skill.md. Дослідження перевіряє переносимість навичок між масштабами моделей та між інструментальними обгортками Codex і Claude Code, і показує, скільки вбудованого виграшу зберігається при переміщенні.
Що таке SkillOpt і як працює цей оптимізатор?
SkillOpt оптимізує текстову «навичку» окремим документом, не змінюючи цільову модель. Оптимізатор пропонує локальні правки і приймає лише ті, що підвищують скор на відкладеній вибірці. На виході маємо один артефакт best_skill.md, готовий до розгортання.
Процес простий за формою і суворий за критеріями. Оптимізатор читає прогони, де кожен крок має оцінку, і генерує варіанти редагувань. Межі правок визначені: додавання, видалення або заміна фрагментів. Відбірна частина приймає правку тільки при строгому прирості скора. Так фіксується кожне покращення.
Цільова модель не перенавчається і не підлаштовується. Саме текст навички несе всю зміну поведінки. Це зміщує витрати у фазу тренування оптимізатора та спрощує розгортання. В інференсі артефакт — звичайний вхідний текст.
Сенс метрики «Transfer» також чіткий. «Baseline» — це робота без навички. «Direct» — навичка, оптимізована під цю цільову систему. «Transferred» — навичка, навчена деінде і застосована без додаткової оптимізації. Коректне питання: скільки «внутрішньодоменного» виграшу переживає перенос?
Що показує перехід між масштабами моделей у межах однієї сім'ї GPT?
Передача в межах сім'ї GPT-5.4 працює, але нерівномірно. SpreadsheetBench на GPT-5.4-mini зберігає 82% виграшу: було 36.1 без навички, 47.5 з «Direct», а «Transferred» дає 45.5. Це майже «безкоштовне» повторне використання.
Є і несподіванки. У LiveMath на GPT-5.4-nano «Transferred» дає 28.8 проти 27.2 у «Direct». Частка виграшу — 140%. Дослідники читають це як ознаку процедур, нечутливих до конкретної цільової моделі. Деякі правила переживають зміну масштабу без втрат.
Слабкою лишається SpreadsheetBench на GPT-5.4-nano — лише 16% збереженого виграшу. У LiveMath на GPT-5.4-mini частка становить 25%. Отже, утримання не є рівномірним. Водночас важлива межа витримана: жоден рядок не падає нижче «Baseline» цільової моделі.
Обсяг експерименту чітко окреслений. Усі чотири рядки — лише в межах однієї сім'ї GPT. Перенос між сім'ями, наприклад із GPT до Qwen, у цьому матеріалі не тестувався. Ви теж це врахуєте під час оцінки ризиків?
Чому перехід між обгортками Codex і Claude Code — найсильніший результат?
Тут ефект найбільш практичний: усі рядки працюють на GPT-5.5, а перенос між інструментальними обгортками вражає. Найгучніший приклад — SpreadsheetBench: навичка, оптимізована в Codex, піднімає Claude Code з 22.1 до 81.8. Це навіть трохи вище за 80.4, досягнуті «Direct» у Claude Code.
Чому це показово? Обгортки відкривають різні API для інструментів і файлів та інші командні поверхні. Якщо навичка виживає після такої зміни, вона не кодує «рецепти команд». Дослідження пов'язує переносимість SpreadsheetBench із процедурним рівнем робіт: огляд структури книги, верифікація формул і матеріалізація статичних значень. Ці практики лишаються валідними, незалежно від того, який CLI запускає Python.
У LiveMath історія протилежна. Перехід Codex → Claude Code зберігає лише 10% внутрішньодоменного виграшу. Асиметрія варта уваги. Процедурні навички — як інспектувати, перевіряти, форматувати — переносяться краще. Навички з важким міркуванням тісніше прив'язані до середовища навчання.
“structure-first inspection, formula-aware verification, and static-value materialization.”
Чи не це ваш критерій вибору задач для переносу? Якщо завдання — таблиці і чіткі процедури, шанси високі. Якщо потрібні складні математичні міркування, очікуйте менший перенос і плануйте «Direct» оптимізацію на цілі.
Чи працює перенос між бенчмарками і як його читати?
Перехід між бенчмарками реальний, але невеликий. Навичка з OlympiadBench переноситься на Omni-MATH з позитивним приростом на трьох масштабах моделей GPT-5.4: +3.7, +1.8 і +1.3 до «Baseline». «Direct» для Omni-MATH не звітувався, тому порівняння йде лише проти «no-skill».
Дослідники інтерпретують це як збереження процедурних математичних прийомів. Вони витримали і зміну тестових інстансів, і зміну конвенцій форматування відповідей. Виграші малі, але стабільно додатні. Це сигнал, що не лише інструментальна поверхня має значення.
Що це означає для вас? Якщо ви тренуєте навичку на одному наборі задач, вона може перенести частину корисних прийомів на інший. Не розраховуйте на великі прирости без «Direct», але плануйте базове підсилення навіть без додаткової оптимізації.
Це також підказка для дизайн-процесу. Вкладайтеся у процедурні правила, які не залежать від формату конкретного бенчмарку. Такі правила мають вищий шанс пережити перенос без деградації.
Чому артефакт взагалі переноситься і що це змінює в операціях?
Механізм прозорий. Усі три режими виконання — прямий чат, Codex, Claude Code — споживають один і той самий формат best_skill.md. Спільний контракт і робить можливим крос-обгортковий експеримент. Жоден із хенесів не має «особливого» формату навички.
Codex рендерить поточну навичку у пер-задачний SKILL.md поруч із файлами завдання і читає стиснутий трейс виконання. Claude Code віддзеркалює той самий контракт робочої області через CLI «claude». Форма артефакту також сприяє переносимості: підсумкові навички мають 379–1 995 токенів із медіаною близько 920 і збираються з 1–4 прийнятих правок. Приклади правил у Figure 4 — процедурні, не прив'язані до інстансів. Для SpreadsheetBench правило дослівно: inspect workbook structure and formulas, then write evaluated static values across the full requested target range instead of relying on Excel recalculation.
Витрати тренування — одноразові, офлайн і пораховані. Залежно від бенчмарку, це 0.6M–46.4M тренувальних токенів на абсолютний тест-поінт. SpreadsheetBench — близько 0.6M, DocVQA — 46.4M. Оптимізатор працює лише під час тренування і не додає жодних викликів на інференсі. Якщо навичка, натренована в одній обгортці, тримається в іншій, то ця одноразова ціна розтікається на кілька середовищ.
Є і «операційний» плюс. Деплойте текстовий файл, який фахівець домену прочитає за хвилини. Кожна зміна відслідковується: крок фіксує edit_apply_report.json зі статусом прийняття чи пропуску для кожної правки. Портативність плюс інспектованість — інший підхід, ніж постачання тонко налаштованих ваг.
Нарешті, межі узагальнення важливі. Докази покривають одну сім'ю GPT і по два бенчмарки на вісь. Тож ми бачимо демонстрацію переносимості, але не загальну теорію. При цьому всі 4 крос-модельні, 4 крос-обгорткові та 3 крос-бенчмаркові результати розташовуються вище «Baseline» цілі. Це надійний нижній бар'єр для практичних рішень.
На основі матеріалу MarkTechPost.