AI Новини

Qwen-Audio-3.1: повнодуплексний голос, різке здешевлення та тренування Think–Act–Speak

Повнодуплексний голосовий агент, 262K контекст, інструменти, веб-пошук і великі знижки.

2026-09-29 ·Hai Anton

Команда Qwen від Alibaba представила Qwen-Audio-3.1 — аудіостек із п’яти моделей для ASR, TTS і взаємодії в реальному часі. Центральна новинка — Qwen-Audio-3.1-Realtime, повнодуплексна голосова модель для агентів, що викликають інструменти. Компанія суттєво знизила ціни: приблизно на 85% для Realtime, близько 70% для TTS і до 95% для ASR. Доступ є як керований API через QwenCloud по WebSocket. Відкриті ваги не оголошувалися, тож самостійний хостинг недоступний.

Що саме релізнула команда Qwen і що в центрі стека?

Qwen випустила Qwen-Audio-3.1 — стек із п’яти аудіомоделей, що охоплює ASR, TTS і повнодуплексну взаємодію. Головна модель — Qwen-Audio-3.1-Realtime — створена для голосових агентів, які міркують, викликають інструменти та керують почерговістю. Вона орієнтована на двосторонній діалог без пауз і жорсткої черги реплік.

Фокус на повнодуплексі дозволяє слухати та говорити паралельно. Модель приймає мовні підказки, вирішує, коли відповідати, і стрімить голос у відповідь. Конструкція підходить для сценаріїв із частими перебиваннями, уточненнями та швидким зворотним зв’язком.

Стек покриває розпізнавання мовлення, синтез мовлення та інтерактивність. Це зменшує тертя між перетворенням голосу в текст, міркуванням і голосовою відповіддю. У підсумку ви отримуєте послідовну поведінку агента упродовж усієї розмови.

Qwen також підсилила інструментальність моделі. Реалізовано виклики функцій, пошук у вебі, структуровані виводи та кеш контексту. Передбачено донавчання, що допомагає вирівняти відповіді під доменні процеси й голосові сцени.

Чому це важливо саме зараз? Голосові інтерфейси швидко стають нормою. Повнодуплексний режим скорочує когнітивне навантаження і підтримує природний темп живої бесіди. Агент не лише чує, а й діє, читає контекст і тримає курс на ціль.

«A 5-model audio stack spanning ASR, TTS and realtime interaction.»

Де запустити модель і як формується вартість?

Qwen-Audio-3.1 доступна як керований API. Модель qwen-audio-3.1-realtime-plus працює на QwenCloud через WebSocket. Відкриті ваги не анонсували, тож розгортання обмежується хмарним доступом через керовану інфраструктуру.

Сторінка моделі вказує, що вхід і вихід підтримують текст і аудіо. Контекст — 262K токенів, із максимумом вхідних 245K і вихідних 16K. Типові межі — 60 запитів і 100K токенів за хвилину. Це задає зрозумілі рамки продуктивності для інтерактивних сценаріїв.

Ціни такі: $6.4 за 1M аудіовхідних токенів і $0.8 за 1M текстових вхідних токенів. Текст і аудіо на виході коштують $24 за 1M токенів, при цьому текстовий вихід не тарифікується. Така сітка робить голосові інтеграції прогнозованими за витратами.

Ключові можливості включають виклики функцій, веб-пошук, структуровані виводи, кеш контексту і донавчання. Вони дають змогу будувати програмно керовані сценарії, поєднувати інструменти, опоратися на політики й повертати чітко типізовані відповіді. Це корисно, коли мова йде про оновлення стану чи перевірку дозволених дій.

Є супутня модель для офлайн-транскрипції довгих записів — Qwen-Audio-3.1-ASR-Flash-Filetrans. Вона підтримує гарячі слова, розділення мовців, пунктуацію та багатомовне розпізнавання плюс китайські діалекти. Вартість — $0.15 за 1M вхідних токенів і $0.47 за 1M вихідних токенів.

«Default limits are 60 requests and 100K tokens per minute.»

Архітектура: дві моделі за одним голосом — як це працює?

Під капотом працюють дві моделі з однаковим аудіоенкодером і LLM-дизайном. Перша — повнодуплексна модель прийняття рішень. Вона визначає, коли слухати, коли говорити, коли зупинятися та коли відновлюватися. Друга — модель перетворення мовлення в текст для складання змісту відповіді.

Коли текст готовий, контекстно-обізнаний голосовий рендер перетворює його у стрімінгове мовлення. Рендерер умовно залежить від історії бесіди, голосових підказок і акустичного контексту. Це зберігає тон, ритм і доречність, які слухач очікує від живого співрозмовника.

Такий поділ ролей дає вигідну декомпозицію. Рішення про почерговість не плутаються з формулюванням змісту, а синтез не нав’язує логіку відповіді. Замість цього ланцюжок Think–Act–Speak працює прозоро, керовано та відтворювано.

Архітектура сприяє дисципліні в управлінні голосом. Агент може швидко припинити фразу, дочекатися уточнення і повернутися до теми. Потім він оперативно рендерить промову, не втрачаючи тону і динаміки розмови.

«Architecture: 2 Models Behind 1 Voice.»

Як тренували: Think, Act, Speak and Coordinate

Навчання організовано на трьох шарах: Think, Act і Speak and Coordinate. Спершу модель думає та узгоджується з текстовим LLM. Далі вона діє в керованих середовищах і отримує винагороди. Нарешті вона вирішує, коли і як говорити, узгоджуючи дуплекс.

У шарі Think застосовано M²-OPD. Core-Cocktail SFT повторно ранжирує аудіомодель відносно вихідного текстового LLM, використовуючи парні дані масштабу мільйонів годин. Далі йде мультимодальний OPD із оцінкою кожного токена власної траєкторії студента.

Тут працює Text Teacher і «заморожений» Audio Reference, які скорюють кожен токен. Це on-policy дистиляція, а не імітація заготовлених відповідей. Потім доменні експерти з емпатії, прагматичних намірів і акустичних сцен тренуються через GRPO. Multi-Teacher OPD зливає їх в один розгортаний варіант.

Шар Act — це виконувані середовища. Кожен домен постачається з пулом інструментів, станною JSON-базою та бізнес-політикою природною мовою. Домени сідуються з відкритих описів інструментів і визначень MCP-серверів.

Кожне завдання завершується одним із трьох результатів: записом, мотивованою відмовою або непідтримуваним запитом. Оцінювання перевіряє термінальний стан, далі дозволені записи, а потім поведінкові асерції. Вільна, гладка відповідь не рятує провал підсумкової перевірки стану.

«A fluent reply cannot rescue a failed state check.»

GRPO отримує винагороди на рівнях діалогу, віхи та черги. Для пошуку тренування штрафує зайві запити за формулою r_query = q min(1, n_ref / n_pred). Середня кількість запитів на один виклик пошуку впала з 4.37 до 1.05, але Trigger F1 знизився з 60.87% до 58.61%.

Шар Speak and Coordinate вирішує, чи говорити, коли говорити і як говорити. На Full-Duplex-Bench v1.5 відповіді людям, що говорили з кимось іншим, зменшилися з 0.13 до 0.03. На v3.0 частота заповнювачів впала з 0.7590 до 0.2960.

Є компроміси. Після перебивань небажане відновлення зросло з 0.035 до 0.130. Затримка зупинки при перебиванні — 1.116 секунди проти 0.383 у GPT-Realtime-2. Це корисний маркер для адаптації очікувань під конкретні сценарії.

«Interruption stop latency is 1.116 seconds, versus 0.383 for GPT-Realtime-2.»

Порівняння, бенчмарки та головні висновки — де стоїть Qwen-Audio-3.1?

Зростання помітне на низці метрик. Порівняно з 3.0, Audio MultiChallenge підіймається з 47.12 до 52.21. Середнє значення 14-мовного BBA — з 81.7% до 88.1%. FLEURS WER зменшується з 9.01 до 3.98. Це підкреслює прогрес у розумінні та багатомовності.

Є важливе застереження. Показники τ-Voice використовують напівдуплексну адаптацію speech-to-text і не порівнювані з офіційними повнодуплексними результатами. У 50-сесійній перевірці людьми GPT-Realtime-2 все ще попереду — 96.00% проти 92.00%. Це ставить планку продуктивності для польових тестів.

Інтерактивний пояснювач допомагає розібрати цикл Think–Act–Speak. Там показано дуплексні рішення, оцінену навчальну сесію та штраф за пошук. Це корисно, коли ви хочете побачити конкретні механіки роботи, а не лише підсумкові цифри.

Як виглядає порівняння з іншими? Qwen-Audio-3.1-Realtime-Plus приймає текст і аудіо та повертає текст і аудіо. OpenAI GPT-Realtime-2 працює з текстом, аудіо та зображенням і теж повертає текст і аудіо. Google Gemini 3.8 Live приймає текст, зображення, аудіо, відео та повертає текст і аудіо.

Контекстні рамки різняться. Qwen пропонує 262K контекст і максимум 16K виходу. У GPT-Realtime-2 — 128K контекст і 32K виходу. У Gemini 3.8 Live — 131,072 контекст і 65,536 виходу. Це впливає на довжину діалогів і розлогість відповідей.

Функціональні виклики доступні в усіх трьох. У Qwen вбудований веб-пошук, у GPT-Realtime-2 він не зазначений. У Gemini пошук прив’язаний до Google Search grounding. У Qwen — Thinking mode з 2K max reasoning; у GPT — налаштовувані зусилля; у Gemini — чергування міркувань.

Ціни також контрастують. Аудіовхід у Qwen — $6.4 за 1M токенів, у OpenAI — $32, у Google — $3.00. Аудіовихід у Qwen — $24, у OpenAI — $64, у Google — $12.00 за 1M. Відкритих ваг немає в усіх трьох. Джерела — QwenCloud, OpenAI docs і Model page.

Зауважте, ціни — це прейскуранти, перевірені 28 вересня 2026 року. Тарифікація токенів у різних постачальників для аудіо відрізняється, тому пряме порівняння ставок некоректне. Це контекст для приблизної орієнтації, а не для бухгалтерської еквівалентності.

Ключові висновки можна звести до кількох пунктів. На τ-Voice-адаптації успішність завдань зростає з 78.4% до 82.0% порівняно з 3.0. Відповіді на фонове мовлення падають із 73.0% до 13.0% на Full-Duplex-Bench v1.5. Це явне зміцнення дисципліни слухання.

Далі — масштаб і вартість. 262K контекст, виклики функцій і веб-пошук доступні за $6.4 за 1M аудіовхідних токенів. Інструментальність тренується через GRPO у саморозвивних виконуваних середовищах. Багатокрокові атаки знижуються до 26.0% (китайська) і 23.5% (англійська).

Що таке Qwen-Audio-3.1-Realtime? Це повнодуплексна голосова модель від команди Qwen для агентів, які міркують, викликають інструменти й керують почерговістю. Вона слухає, говорить, зупиняється та відновлюється в реальному часі. Основний акцент — на продуктивній, керованій розмові.

Чи можна розгорнути самостійно? Відкриті ваги не оголошені. Доступ надається через API QwenCloud як qwen-audio-3.1-realtime-plus. Підключення — по WebSocket, що спрощує побудову інтерактивних каналів.

Скільки це коштує? $6.4 за 1M аудіовхідних токенів і $24 за 1M вихідних токенів для тексту та аудіо. Текстовий вихід не тарифікується. Такі правила дають чіткі очікування щодо бюджету.

На основі матеріалу наданого джерела.

Готові автоматизувати свій магазин?

Ми проаналізуємо ваші процеси, знайдемо вузькі місця та запропонуємо конкретний план автоматизації. Перша консультація — безкоштовна.

Написати в Telegram →
Гай Антон
Гай Антон

Засновник HAIQ — AI Automation Agency. Засновник HAIQ. Будую автоматизації та AI-рішення для українського e-commerce на базі n8n. Пишу про автоматизацію, чат-ботів та AI для бізнесу.