Anthropic представила Claude Haiku 5.5 — свою найдешевшу та найшвидшу «малу» модель. Вона розрахована на великий обсяг рутини: узагальнення, стиснення, класифікацію та задачі сабагентів. Модель зберігає вікно контексту 1M токенів і до 128K токенів у відповіді. Ціна стартує від $0.10 за мільйон вхідних і $0.50 за мільйон вихідних токенів для підказок до 100K. Це на 90% нижче за Haiku 4.5 на коротких підказках. Готові розібратися, де вона виграє і як її застосувати у вашому стеку?
Що саме запустила Anthropic з Haiku 5.5?
Anthropic випустила «малий» Claude Haiku 5.5 із фокусом на швидкість і ціну для великих обсягів. Він зберігає 1M контекст, до 128K токенів у виводі та отримав керування мисленням: адаптивне мислення увімкнено за замовчуванням, параметр effort за замовчуванням — medium.
Модель приймає текст та зображення, повертає текст і має зріз знань на червень 2026 року. Пакетні джоби в бета-режимі підтримують до 300K токенів у виході. Це відкриває шлях до тривалих партійних сценаріїв без перепроектування пайплайнів.
Є два важливі нюанси конфігурації. Нестандартні значення temperature, top_p або top_k повертають помилку 400. Новий токенайзер також рахує приблизно на 30% більше токенів за той самий текст, ніж у Haiku 4.5. Посібник з міграції покриває обидва аспекти.
Чи можна це розгорнути відразу? Так. Haiku 5.5 доступний як хостингований API: Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry і Claude Platform on AWS. Шукаєте базову швидкість, стабільний контекст і мінімальну ціну? Це якраз цей випадок.
Як працює ціноутворення і скільки ви реально заплатите?
Ціни розбиті на два рівні. До 100K токенів у промпті вхід коштує $0.10, вихід — $0.50 за 1M токенів. Ви також платите $0.01 за 1M за читання кешу та $0.125 за 5-хвилинний запис у кеш. Вище 100K токенів ставки зростають до $0.50 за вхід і $2.50 за вихід.
Для порівняння, Haiku 4.5 коштував $1 за вхід і $5 за вихід. Anthropic зазначає, що близько 90% запитів до Haiku 4.5 залишалися нижче 100K токенів. З урахуванням нового токенайзера компанія оцінює, що Haiku 5.5 у середньому приблизно на 75% дешевший. Пакетна обробка додає ще 50% знижки.
На коротких промптах нижня межа ціни для Haiku 5.5 збігається з GPT-6 Luna. Але зверніть увагу на пороги: у Haiku підвищення цін починається від 100K, у Luna — від 272K. Якщо ваші промпти часто переходять поріг, структура витрат зміниться.
Ще дві практичні ремарки. Помилка 400 при зміні temperature/top_p/top_k може зламати старі інтеграції — перевірте налаштування клієнтів. А новий підрахунок токенів на ~30% вищий означає, що «старі» підказки можуть перетнути 100K-ліміт раніше, ніж очікували. Плануєте пакетну обробку, щоб отримати додаткові 50% економії?
Як Haiku 5.5 показує себе на бенчмарках?
За опублікованими цифрами, Haiku 5.5 суттєво просунувся відносно Haiku 4.5 і демонструє конкурентні результати проти GPT-6 Luna та інших. Особливо помітні прирости на OSWorld 2.1 (offline subset) і Terminal-Bench 4.0. Водночас лідером сімейства залишається Sonnet 5.5.
OSWorld 2.1 (offline subset) показує 72.4% у Haiku 5.5 проти 48.9% у GPT-6 Luna і 15.7% у Haiku 4.5. Terminal-Bench 4.0 дає 39.2% для Haiku 5.5 проти 16.4% у Luna і 0.0% у Haiku 4.5. FrontierCode 1.1 (Main) — 46.4% для Haiku 5.5 проти 42.4% у Luna.
На Humanity’s Last Exam Haiku 5.5 показує 45.9% без інструментів і 57.4% з інструментами. На GDPval-AA v2.1 він має 1620 балів проти 1437 у Luna і 735 у Haiku 4.5. Водночас Sonnet 5.5 очолює кожний рядок, включно з 70.6% на Terminal-Bench 4.0. Для складного агентного кодування Anthropic рекомендує Sonnet 5.5 та Opus 5.5.
All figures below are Anthropic-reported.
Що це означає для вибору? Haiku 5.5 — не «лід-кодер», а сильний сабагент і робоча конячка великих черг. Коли потрібні кращі бали й розширена агентність, дивіться на Sonnet 5.5 або Opus 5.5. Потрібні швидкість, стабільна якість і ціна? Haiku 5.5 виглядає влучно.
Де Haiku 5.5 спрацює найкраще прямо зараз?
Три типи навантажень пасують найкраще. По-перше, робота сабагентів під Opus 5.5 або Sonnet 5.5. Наприклад, у Rogo сабагент на Haiku 5.5 тягне рядок виручки з 10-K, поки «старша» модель збирає презентацію.
По-друге, документоорієнтоване Q&A та узагальнення у великому потоці. AlphaSense тестувала модель на фічі, що обробляє близько 8 мільйонів викликів на тиждень. Така економіка підходить для масштабованих корпоративних сценаріїв.
По-третє, сценарії, де критична швидкість: живпідтримка клієнтів та робота у браузері. Тут навіть невелика економія на токенах із стабільною латентністю дає відчутний виграш у витратах і досвіді.
Тож як вибрати між «сабагентом» і «ведучою» моделлю? Орієнтуйтеся на завдання: масові скорочення й витяги — Haiku 5.5; складні довгі ланцюжки планування і кодування — Sonnet 5.5 або Opus 5.5. Це спрощує дизайн агентної системи.
Як Haiku 5.5 виглядає на тлі найближчих конкурентів?
На короткому контексті прайси однакові у Haiku 5.5 та GPT-6 Luna: $0.10 за 1M вхідних і $0.50 за 1M вихідних. У Gemini 3.5 Flash-Lite це $0.30 та $2.50 відповідно. Довгий промпт змінює картину: у Haiku вище 100K — $0.50/$2.50; у Luna вище 272K — $0.20/$0.75; у Gemini — плоска ставка.
Читання кешу коштує $0.01 у Haiku і Luna, а у Gemini — $0.03 плюс зберігання. Контекстні вікна близькі: 1M у Haiku, 1,050,000 у Luna та 1,048,576 у Gemini. Максимальний вивід: 128K у Haiku і Luna та 65,536 у Gemini.
За типами вводу Haiku й Luna приймають текст та зображення; Gemini підтримує текст, зображення, відео, аудіо та PDF. Контроль міркувань: у Haiku — adaptive thinking плюс effort (за замовчуванням medium); у Luna — reasoning.effort від none до max (за замовчуванням medium); у Gemini мислення підтримується. Комп’ютер-юз: SDK у бета у Haiku, Responses API у Luna, Preview у Gemini. Знижка на батч — 50% у всіх трьох.
Зрізи знань такі: червень 2026 у Haiku, 18 травня 2026 у Luna, а у Gemini сторінка моделі не містить цього поля. Де запускати? Haiku — Claude API, Bedrock, Google Cloud, Microsoft Foundry, Claude Platform on AWS. Luna — OpenAI API. Gemini — Gemini API. Підсумок із «Key Takeaways»: однакова ціна з Luna на короткому контексті, Luna дешевша вище 100K; Haiku 5.5 позиціонують як сабагент під Opus 5.5 та Sonnet 5.5, а не як лідера кодування. Готові визначити свій поріг і роль моделі у вашій системі?
На основі матеріалу наданого джерела.