Google Research представив AI відеоспіврежисера для генерації довгих відео. Це набір із чотирьох агентних фреймворків, які перетворюють короткі кліпи на узгоджені, хвилинні історії. Система адресує дві головні причини провалів у багатокадрових пайплайнах: дрейф ідентичності та каскадні помилки. Вона працює поверх існуючих генераторів і успадковує їхні водяні знаки. Ви отримаєте історію зі стабільними героями, локаціями та реквізитом, а також механізми самокорекції. Хочете зрозуміти, як це зібрано та чим це краще за звичні підходи?
Що таке AI відеоспіврежисер Google?
Це модельно-агностичний оркестратор із чотирьох фреймворків, що керує плануванням, пам’яттю, довгою генерацією та самокорекцією. Він перетворює набір коротких кліпів на узгоджену, багатокадрову історію тривалістю в хвилини. Система націлена на дві критичні проблеми: дрейф ідентичності та каскадні помилки.
Відеоспіврежисер працює поверх Gemini та Veo. Завдяки модельній агностиці та багаторівневій оркестрації той самий шар може керувати й іншими генераторами. Усі вихідні матеріали успадковують SynthID від базових моделей. Це підтримує прозорість походження контенту.
Команда подає задачу як проблему призначення «кредиту». Якщо фінальний ролик зламаний, важко відстежити, який саме промпт все зіпсував. Новий шар збирає сигнали якості та відправляє зворотний зв’язок туди, де його можна виправити.
Результат — цілісний контроль за історією на рівні світу, а не лише окремих кліпів. Ви отримуєте безперервність образів і станів, а також механізми раннього виявлення збоїв. Звучить як надійніший шлях до виробничих довгих відео, чи не так?
Подальші секції розкривають, чому звичайні підходи ламаються, та як чотири фреймворки працюють разом. Готові побачити, з чого складається така узгодженість?
Чому довгі AI‑відео розвалюються?
Проблема виникає при зшиванні кліпів у цілісну історію. Незалежні, вручну зібрані промпти спричиняють семантичний дрейф і каскадні помилки. У результаті змінюються костюми або сцени, а один поганий актив ламає всі наступні кадри.
Дифузійні моделі легко рендерять красиві уривки за секунди. Та коли ви зводите їх у наратив, мікропохибки накопичуються. Одяг персонажа раптово інший, чи камінь стає іншим кольором. Це руйнує відчуття безперервності та довіру до історії.
Каскадні збої ще гірші. Якщо рання сцена згенерувала хибний реквізит, кожне наступне рішення будується на цій помилці. Таке доміно складно зупинити без зовнішнього контролю якості.
Додайте до цього «кредитне» питання: як знайти винний промпт у довгому ланцюгу? Без адресної оцінки кожного модуля виправлення перетворюється на гру навмання. Тому і потрібна глобальна оркестрація та пам’ять.
Чи можна навчити пайплайн самостійно виявляти дрейф і блокувати ланцюжок збоїв? Саме це і робить новий підхід.
Що всередині: чотири фреймворки в дії
Система об’єднує Co-Director, CANVAS, A²RD і VQQA. Разом вони планують, зберігають візуальну пам’ять, генерують довгі сегменти та переписують промпти за зворотним зв’язком. Кожен фреймворк адресує свій клас збоїв.
Co-Director реалізує креативне планування як multi-armed bandit. Оркестратор вибирає конфігурацію між Creative Strategy, Narrative Mode та Aesthetic Archetype. Далі агент препродакшену створює сторіборд, а підагенти Keyframe, Video та Audio генерують медіа. MLLM‑Judge оцінює версію та повертає факторизовану винагороду назад у bandit-пошук.
CANVAS виступає персистентною візуальною пам’яттю. Він відстежує персонажів, локації та стани об’єктів і повертає збережені візуальні «якорі» при повторних сценах. У тесті музейного пограбування AutoStudio втратив кепку злодія, а Gemini‑3.1‑Pro змінив коштовний камінь. CANVAS зберіг обидві деталі стабільними.
A²RD — це тренінг‑фрі архітектура для довгих відео сегмент за сегментом. Кожен сегмент проходить цикл Retrieve, Synthesize, Refine, Update відносно мультимодальної відеопам’яті. Агент перемикається між екстраполяцією для нових сюжетних подій та інтерполяцією для повернення сутностей. Було показано 10‑хвилинний фільм, згенерований таким способом.
VQQA формує замкнений контур уточнення промптів. Воно генерує візуальні запитання до кожного промпту, а критика VLM слугує «семантичними градієнтами» для переписування тексту. Доступу до внутрішніх параметрів моделей не потрібно. Global Selection обирає найкраще відео серед усіх ітерацій, а не лише останній варіант.
«Кожен сегмент у A²RD проходить Retrieve, Synthesize, Refine, Update проти мультимодальної відеопам’яті»
Що показують бенчмарки і оцінки?
Створено три нові бенчмарки для вимірювання безперервності та узгодженості. GenAD‑Bench містить 400 сценаріїв реклами для 200 вигаданих продуктів із 50 брендів. HardContinuityBench фокусується на повторних сценах і змінах станів реквізиту. LVBench‑C має 120 сценаріїв, де ключові активи зникають щонайменше на 10 сегментів.
Co‑Director набрав 81,4 у середньому на GenAD‑Bench і 3,96 з 5 за оцінками людей, за даними проєктної сторінки. У базових орієнтирах були Veo 3.1, Kling 3.0 Omni, Wan 2.6 і MovieAgent. Це задає планку для агентних оркестраторів у багатокадрових історіях.
CANVAS покращив безперервність фону на 21,6%, узгодженість персонажів на 9,6% і узгодженість реквізиту на 7,6%. Такі зрушення зменшують «шви» між сценами, особливо коли сутності повертаються після перерв.
A²RD дав до 30% кращої узгодженості та 20% кращої наративної цілісності на відео від однієї до десяти хвилин. Це підкреслює важливість пам’яті на рівні сегмента та контрольованої авторегресії без додаткового донавчання.
VQQA показав абсолютні прирости на 11,57% на T2V‑CompBench та 8,43% на VBench2 порівняно зі звичайною генерацією. Оцінювання ітерацій з Global Selection дозволяє утримувати найкращий варіант, а не покладатися на останню спробу.
Co‑Director: 81,4 на GenAD‑Bench; CANVAS: +21,6% фон, +9,6% персонажі, +7,6% реквізит; A²RD: до +30% узгодженість; VQQA: +11,57% і +8,43% над базою
Як це виглядає у порівнянні — і на що звернути увагу
Порівняння показує чіткі відмінності. Вихід системи Google — хвилинне багатокадрове відео з озвученням і саундтреком. StoryMem генерує хвилинне багатокадрове відео. MovieAgent видає багатосценове відео з субтитрами та аудіо. AutoStudio створює багатокрокові послідовності зображень, без відео.
Архітектурно Google застосовує чотири фреймворки в ієрархічному мультиагентному шарі оркестрації. StoryMem — це Memory‑to‑Video дифузійна модель пострічково. MovieAgent будує план через мультиагентний chain‑of‑thought (режисер, сценарист, художник‑сторібордист, менеджер локацій). AutoStudio базується на трьох LLM‑агентах і одному агенті на Stable Diffusion.
Механізми узгодженості також різняться. Google поєднує персистентну візуальну пам’ять CANVAS і мультимодальну відеопам’ять A²RD. StoryMem спирається на keyframe‑банк пам’яті з попередніх шотів. MovieAgent використовує ієрархічне планування плюс персоналізацію на рівні персонажів. AutoStudio тримає суб’єкт‑менеджер і Parallel‑UNet.
Замкнені контури самокорекції у Google включають bandit‑пошук з MLLM‑Judge та VQQA з Global Selection. StoryMem використовує відбір семантичних ключових кадрів і естетичну фільтрацію. У MovieAgent та AutoStudio такі механізми не зазначені. Базові генератори в Google — Gemini і Veo, при цьому шар лишається модельно‑агностичним.
Нарешті, про тренування, довжину та код. Google не робить донавчання й оркеструє наявні моделі; A²RD показав 10 хвилин. StoryMem застосовує LoRA‑тюнінг на базовій моделі та дає близько хвилини. MovieAgent використовує per‑character LoRA. AutoStudio — тренінг‑фрі. Код Co‑Director і A²RD відкритий, CANVAS «coming soon»; інші системи мають публічні репозиторії. Ключове? Довгі відео — це глобальна оптимізація і відстеження стану світу. Чотири фреймворки закривають планування, сторібординг, довгу генерацію й самокорекцію. Оркестрація працює поверх Gemini і Veo з SynthID. A²RD дав безперервний 10‑хвилинний фільм із стабільними героями і локаціями. Co‑Director набрав 81,4 на GenAD‑Bench проти 75,7 у випадкового пошуку.
На основі матеріалу первинного матеріалу.