Синтез движения (Motion Capture Synthesis)

ИИ-синтез движения — это генерация реалистичного движения персонажа, жестов рук, мимики или анимации всего тела из минимального входного сигнала — текстового описания («персонаж уверенно идёт, затем останавливается и нервно оглядывается»), обычного неструктурированного референсного видео (извлечение и перенацеливание движения из обычной съёмки на телефон на риггированного 3D-персонажа), или разреженного набора вручную расставленных ключевых кадров, которые модель интеллектуально заполняет между собой, — без необходимости в традиционной студии захвата движения (mocap) с маркерами на костюме и выделенными массивами камер. Модели обучаются на больших библиотеках профессионально записанных данных захвата движения, изучая статистическую структуру естественного движения человека — как отдельные суставы движутся относительно друг друга, как импульс и баланс физически ограничивают то, какие позы вообще возможны, — что позволяет им генерировать совершенно новые, физически правдоподобные последовательности движения, никогда явно не захваченные или не записанные каким-либо актёром, или извлекать пригодный для использования скелет движения из 2D-видео с помощью техник оценки позы и перенацеливать его на совершенно другую 3D-модель персонажа с другими пропорциями тела и другой структурой рига, чем у того, кто изначально выполнял исходное движение перед камерой. Почему это важно для SaaS-разработчиков: синтез движения резко снижает порог стоимости для анимации персонажей в разработке игр, виртуальном продакшне/предвизуализации фильмов и продуктах аватаров/цифровых людей, которым нужна библиотека естественных жестов (помахать, кивнуть, пожать плечами) без найма mocap-актёров и студийного времени для каждого нужного движения — независимые разработчики могут сгенерировать анимацию «цикл ходьбы» или «фидджетинг в состоянии покоя» из текстового промпта или видео на смартфоне, где они сами выполняют это движение, вместо лицензирования пакета анимаций или бронирования сессии захвата движения. Это также технология, которая позволяет продукту генерации аватаров или цифрового человека анимировать язык тела и жесты, а не только движение губ, во время сгенерированного видео или живого разговора. Конкретный пример — инди-игровая студия пополняет библиотеку анимаций NPC: (1) команде нужна анимация ожидания «нервное ёрзание» для фонового персонажа, но нет бюджета на mocap; (2) разработчик снимает себя на телефон, выполняя грубое приближение желаемого движения в обычной комнате; (3) видео загружается в API синтеза движения, который извлекает скелет позы с помощью оценки позы на основе видео и перенацеливает его на существующий риг персонажа игры, сглаживая и очищая зашумлённые данные движения из телефонного видео в процессе; (4) полученный клип анимации импортируется напрямую в машину состояний анимации игрового движка.

Похожие термины

Ещё термины: Вывод и медиа