Dyna Robotics представила Dyna-2 — світ-дія модель для маніпуляцій роботами, попередньо навчену на понад одному мільйоні годин егоцентричного людського відео. Це приблизно 170 років безперервного бадьорого досвіду. Команда перевірила, чи може звичайне відео людей замінити дорожчі дані з мітками дій. Вони збудували «драбину» від 1,000 до 1,000,000 годин і проаналізували масштабування. Результати включають закон масштабування на людських даних, його перший перенос на невидимі роботизовані дані та свідчення, що відеопрогнозування веде цей перенос.
Чи готовий Dyna-2 до розгортання сьогодні?
Так, але як система під керуванням постачальника, а не у вигляді відкритих ваг. Компанія не оголошувала публічних чекпоінтів, API чи ліцензій для Dyna-2. Тож розгортання означає придбання роботизованої комірки Dyna, а не самостійний хостинг моделі.
Яким компаніям це підходить найбільше? Dyna-1 уже працює у готелях, ресторанах і пральнях, за заявою компанії. Це наводить на середній сегмент операторів сервісів і багатосайтові підприємства зі стаціонарною, повторюваною маніпуляційною працею. Рішення не підходить для сольних розробників чи лабораторій, які прагнуть локального інференсу.
Цільові індустрії окреслені чітко. Це гостинність, комерційні пральні, харчовий сервіс, легке складання та кітинг, а також клінінг об’єктів. Платформа адресує сценарії, де надійна, повторювана маніпуляція дає найбільший виграш продуктивності.
Після навчання було налаштовано 14 задач, які безпосередньо мапляться на роботу. Серед них — очищення підносів зі сміттям, комплектування аптечок, складання тотів, накладання їжі, зав’язування мотузки, підготовка вішаків і вибіркове діставання напою з холодильника. Такий набір показує прикладну спрямованість можливостей.
Розгортання сьогодні: без ваг і без публічного API, лише комірка робота під управлінням вендора.
Що таке Dyna-2 і як влаштована світ-дія модель?
Dyna-2 — це світ-дія модель (WAM): єдина генеративна модель, що денойзить майбутнє відео і фрагмент майбутньої дії, спільно або окремо, на основі відео-дифузійного бекбону. Вона попередньо навчена на понад одному мільйоні годин егоцентричного людського відео, що приблизно відповідає 170 рокам бадьорого досвіду.
Архітектурно це суміш трансформерів. Відео та дії токенізуються окремо та отримують різні стеки шарів DiT, які взаємно відвідують один одного. Пропріоцепція напряму подається в трансформер дій, забезпечуючи контекст власного стану маніпулятора.
Режими уваги різняться між модальностями. Відеотокени використовують каузальне маскування; токени дій застосовують двонапрямну самоувагу та відвідують контекстні відеотокени. Відеотокени також крос-відвідують текст, проте текст безпосередньо не впливає на токени дій. Така декомпозиція відділяє планування візуальних станів від обчислення політики.
Навчання відбувається за допомогою flow matching. Відеовтрата та втрата дії спільно ділять «стовбур» як два окремі маргінальні поля швидкості. Оскільки мережа дій ніколи не приймає зашумлений відеолатент як аргумент, політика під час інференсу лишається реактивною — вона ні не генерує, ні не відвідує спрогнозоване майбутнє відео. Трансформер дій навмисно зроблено менш глибоким і під’єднано до відеоструменя рано, що, за словами команди, покращує латентність у реальному часі без втрати продуктивності.
Ключ: дії й відео вчаться разом, але політика лишається реактивною, уникаючи залежності від згенерованого відео.
Які результати масштабування команда продемонструвала?
Команда побудувала вкладені підмножини даних на 1,000, 10,000, 100,000 і 1,000,000 годин з однаковими пропорціями джерел. Більший бюджет лише додавав дані, тому криві не пояснюються зсувом розподілу. Фікований роздільний валідаційний набір на 100 годин оцінював кожен щабель драбини.
Перше: закон масштабування тримається на людських даних до одного мільйона годин. Чотири метрики поліпшуються монотонно і лягають у степеневі закони: утримуваний MSE = 0.0691·D^-0.0184 (R²=0.919), accuracy@0.5 = 0.357·D^+0.0203 (R²=0.865). По драбині accuracy@0.1 зростає на 51% проти 12% для MSE, що вказує на різну чутливість метрик до масштабу.
Друге: цей закон переноситься на роботизовані дані, яких модель ніколи не бачила. Ті ж чекпоінти оцінено zero-shot на 39 задачах на двох стаціонарних бімануальних платформах YAM — 12 внутрішніх, 27 із xdof ABC. Zero-shot MSE дій = 0.306·D^-0.0713 (R²=0.884). Команда відзначає злам між 10k і 100k годинами, після якого прирости пришвидшуються.
Третє: ціль навчання критична, а відео — окрема вісь. Спільне денойзинг-навчання перевершило «лише дії» на 39 із 39 задач на кожному масштабі дій. За фіксованих 50,000 годин даних із мітками дій, додавання лише-відео годин знижує zero-shot MSE робота з 0.340 до 0.120. Показово, що помилка на утримуваних людських даних не покращується — користь від відео специфічна для міжвтільного узагальнення.
Закон масштабування тримається, переноситься на роботів і підживлюється спільним денойзингом відео з діями.
Як Dyna-2 показала себе безпосередньо на роботах?
Кожен щабель драбини додатково донавчали на 14 задачах, максимум 10 годин роботоданих на кожну, на трьох втіленнях: 6-DOF руки YAM з паралельними захоплювачами, ті самі руки з 20-DOF спритними кистями WUJI-2 та напівгуманоїд прототип. Післянавчання використовувало лише роботодані — без узгодження «людина-робот» і без ко-навчання.
Середній нормалізований бал зростав 20% → 28% → 45% → 53% по драбині, з найкращими результатами у 9 з 14 задач на одному мільйоні годин. Поворот ключа в боксі — пороговий кейс: 0% аж до 100,000 годин, а потім 90%. Розкручування кришки пляшки донавчали орієнтовно на 10 хвилинах демонстрацій і все одно піднялися до 50%.
У порівнянні з Dyna-1 — виробничою VLA, ініціалізованою з Qwen3-VL-4B, — рання Dyna-2 досягла 1.55× успішності і 1.12× оцінки, агреговано по 7 задачах і 3 чекпоінтах. На нових клієнтських майданчиках Dyna-2 пройшла критерії продакшену в 87% випадків проти 46% у Dyna-1, хоча в себе обидві системи майже стовідсоткові.
Крім того, конвеєр дистиляції скоротив час вибірки відео з 10,203 мс до 110 мс на одному H100. Це безпосередньо підкріплює реальний час і знижує витрати на обчислення, не поступаючись точністю, за висновками команди.
Післянавчання на обмежених роботоданих + дистиляція дали стрибок: 53% середнього балу та 110 мс вибірки відео.
Які головні висновки і що робити далі?
Суть проста: Dyna-2 — світ-дія модель, попередньо навчена на 1M+ годин егоцентричного людського відео. Закони масштабування утримуються на утримуваних людських даних через чотири порядки, а вперше цей закон переноситься zero-shot на роботизовані дані, яких не було в попередньому навчанні. Це структурний сигнал для вектору розвитку робототехніки.
Ключовий драйвер міжвтільного узагальнення — саме спільне навчання з відео, а не додаткові мітки дій. Практичний наслідок — дешевші відеодатасети можуть підвищувати переносимість політик, навіть коли метрики на людських наборах не покращуються. Це відкриває раціональне масштабування без лінійного зростання вартості телоперацій.
З боку розгортання все однозначно. Немає ваг і публічного API: сьогодні це система під управлінням постачальника, що ставиться як комірка робота Dyna. Отже, найближчі бенефіціари — середні оператори сервісів і мережеві підприємства з повторюваними стаціонарними маніпуляціями.
Список задач, індустрій і метрик уже картографується на реальну роботу. Якщо ви працюєте у гостинності, комерційній пральні, харчсервісі, легкому складанні чи клінінгу, то мапа із 14 задач демонструє чіткий шлях від експерименту до операцій.
На основі матеріалу оригінального джерела.