За 30 днів Anthropic, OpenAI і Google DeepMind викотили чотири фронтирні моделі. Claude Fable 5.1 з’явився 1 вересня. GPT-6 Astra — 3 вересня. Наприкінці місяця приземлились GPT-6.1 Sol і Gemini 4 Argon. OpenAI 28 вересня скасувала GPT-6.1 Astra після внутрішніх перевірок. Тепер GPT-6 Astra лишається флагманом OpenAI. Ми ставимо моделі поруч: бенчмарки ближчі, ніж здається з лонч-постів. Але прайс, правила доступу й вартість задачі — різняться суттєво.
Що змінилося в лінійці за вересень?
Ключова подія — скасування GPT-6.1 Astra 28 вересня. Після цього GPT-6 Astra залишається топ-моделлю OpenAI. Інші три релізи лишаються в строю, тож вибір став ширшим, а різниця — тоншою.
Хронологія проста: Claude Fable 5.1 приїхав 1 вересня, GPT-6 Astra — 3 вересня. Наприкінці місяця з’явилися GPT-6.1 Sol і Gemini 4 Argon. Кожен реліз ми вже розбирали окремо; тепер дивимося на них пліч-о-пліч.
Бенчмарки ближчі одне до одного, ніж підказують лонч-нарративи. Лідери міняються залежно від задачі: довгий код, офісна робота, комп’ютерне використання, вразливості чи термінал.
Різницю формують ціни, ліміти та доступ. Списки виглядають схоже, але фактична вартість задачі та кеш-чтення для агентів міняють розклад. Додайте обмеження доступу — і фаворит змінюється. Готові пройтися по цифрам?
Специфікації, ціни й доступ: де моделі розходяться?
Базові ставки у Astra і Fable 5.1 однакові: $10 за вхід і $50 за вихід (за 1M токенів). Sol і Argon коштують у п’ять разів менше: $2/$10. Для Argon це інтродукторна ціна, яка згодом подвоїться.
Кешована ціна на вхідні токени — вирішальна для агентів. Astra бере $1.00 за 1M кеш-чтення. Fable 5.1 — $0.25. Sol — $0.10. Для Argon інтродукторна — $0.10. Різниця множиться в довгих ланцюгах викликів.
Ліміти і вікна контексту різняться несильно: 1.05M у Astra та Sol, 1M у Fable 5.1. Максимальний вихід за відповідь — 128K у всіх, крім Argon: там 1M. Для довгих відповідей це єдиний структурний виняток.
Доступ теж не однаковий. Argon доступний лише в програмі Fairwind. Повна наступальна кіберздатність Astra захована за програмою OpenAI Daybreak; публічна версія відмовляє у складних офензивних завданнях. Антропік тримає необмеженого двійника, Claude Mythos 5.1, у програмах довіреного доступу.
Agents resend system prompts, tool schemas and history on every step. Astra’s $1.00 cache read is 4x Fable 5.1’s and 10x Sol’s.
Хто лідирує на бенчмарках насправді?
Абсолютного переможця немає. Argon веде в знаннєвій роботі та довгогоризонтному інжинірингу коду. Astra лідирує у фронтирній розробці ПЗ та в сценаріях «комп’ютерного використання».
Цифри такі: DeepSWE v1.1 — Argon 77.9%, Astra 74.1%, Fable 5.1 — 67.4%. Vals Index (фінанси, код, юридичні й податкові завдання): Argon 68.9%, Fable 5.1 — 65.8%, Astra 63.1%. FrontierSWE v2: Astra попереду з 65.5% проти 55.0% в Argon і 56.3% у Fable 5.1.
Terminal-Bench 4.0: Astra 58.2%, Fable 5.1 — 57.9%, Argon — 57.4%. CWE-bench v1: нічия між Argon і Astra на 68%, Fable 5.1 — 58%. OSWorld-2.0: Astra 72.6%, Argon 69.2%; у таблиці Google для Fable 5.1 немає значення.
GPT-6.1 Sol відсутній у таблиці Google, але дані OpenAI ставлять його поряд із Astra. На DeepSWE v1.1 Sol зрівнює Astra за близько 1/5 вартості. На OSWorld 2.0 (офлайн-набір) Sol відстає на 2.1 пункти при ~1/7 вартості задачі. На AutomationBench 1.0.6 Sol на 2.2 пункти вище за Claude Opus 5.5 на середньому зусиллі. На Terminal-Bench Science 0.1 лідирує Astra з 68.1%; OpenAI радить її для найважчих досліджень. Незалежні сигнали вказують інше щодо «сирого інтелекту»: на Intelligence Index Astra має 61, а Fable 5.1 — на 5 пунктів вище; у coding-agent індексі Claude Code — 70 проти 67 у Astra. Artificial Analysis також повідомляє, що Argon дорівнює Astra на Intelligence Index. На ARC-AGI-2 Astra має 95%, а Fable 5.1 — 90%.
Собівартість задачі: один прайс, різні рахунки
У Artificial Analysis Claude Fable 5.1 показує $9.18 за задачу проти $4.72 у GPT-6 Astra. Це близько 1.9x, хоча прайс-листи однакові. Різницю робить обсяг токенів, а не ставки.
Коли ціна однакова, більша вартість задачі означає, що Fable 5.1 витратив більше токенів у тій сесії. Антропік також відзначає, що новий токенайзер генерує приблизно на 30% більше токенів з того ж тексту.
Дешевші моделі змінюють картину далі. Artificial Analysis фіксує: Argon дорівнює Astra за Intelligence Index при 60% її ціни за задачу (за інтродукторним прайсом). На Terminal-Bench Science OpenAI рапортує $5.47 за задачу у Sol проти $23.80 у Astra.
Кешування здатне перевернути розклад для агентів. Візьмемо 200K токенів кеш-контексту без вихідних токенів: Astra за $1.00/1M коштує $0.20 за крок і $20 за 100 кроків; Fable 5.1 за $0.25/1M — $0.05 і $5; Sol і Argon (інтро $0.10/1M) — $0.02 і $2. Astra з 200K лишається нижче свого порога довгого промпту 272K.
Caching can reverse the ranking for agents. Measure both on your own traces before you pick on per-task headlines.
Як обирати: лідери за робочими сценаріями
Обирайте під навантаження, а не за загальним рейтингом. GPT-6.1 Sol — дефолт для більшості команд: ціна найнижча публічно, а якість близька до Astra на ключових наборах.
Найскладніша відкрита інженерія? GPT-6 Astra веде FrontierSWE v2 (65.5%). Робота з комп’ютером і браузерні агенти? Знову Astra: OSWorld-2.0 — 72.6%, а Sol у межах 2.1 пункту. Дуже довгі вихідні відповіді (рефакторинги, повні звіти)? Тут унікальний варіант — Gemini 4 Argon із лімітом 1M вихідних токенів на відповідь.
Високоволюмні код-агенти, CI-боти та PR-рев’ю? GPT-6.1 Sol: він зрівнює Astra на DeepSWE v1.1 при $2/$10 і $0.10 кешу. Для легал, фінансів і бізнес-автоматизації — Gemini 4 Argon: він веде Vals Index (68.9%), AutomationBench (51.3%) і Harvey Legal (19.6%). Пошук та латання вразливостей? Argon або GPT-6 Astra, обидва на 68% у CWE-bench v1.
Most numbers here are vendor-reported, and vendors disagree at the margins.
Дві позиції вирішує доступ: сьогодні Argon доступний лише для Fairwind кіберзахисників. Повні офензивні можливості Astra — за Daybreak; публічна версія відмовляє у просунутих офензивних задачах. Anthropic також тримає Claude Mythos 5.1 за бар’єром довіри. Перед перемиканням перевірте нюанси: у Anthropic бенчмарки Fable 5.1 запускались з продакшн-сейфгардами, що могло знизити OSWorld і AutomationBench; у Argon ціна $2/$10 — тимчасова і згодом стане $4/$20; вікно контексту Argon не розкрито; вартість за задачу — це «моментальний знімок» і сильно залежить від рівня зусилля. Є ще дешевший варіант від Anthropic: за нашими матеріалами про Argon, Claude Opus 5.5 б’є Fable 5.1 на ключових агентних бенчмарках за нижчої ціни API й веде Terminal-Bench 4.0 на 66.4%.
На основі матеріалу source material.