Интерполяция кадров

Интерполяция кадров — это ИИ-техника для видео, генерирующая совершенно новые, физически правдоподобные промежуточные кадры между двумя существующими последовательными кадрами исходного видео, используемая для сглаживания воспринимаемого движения или преобразования отснятого материала из более низкой в более высокую частоту кадров (например, с 24 кадров/с до 60 кадров/с) без простого дублирования или кросс-фейда кадров — именно так работали старые методы интерполяции без ИИ, которые создавали заметные артефакты в виде призрачных силуэтов/размытия при быстром движении. Нейронные модели интерполяции кадров (RIFE, DAIN, а также модули интерполяции, встроенные непосредственно в такие инструменты, как Topaz Video AI и большинство современных генераторов видео на базе ИИ) оценивают оптический поток — плотное, попиксельное поле векторов движения, точно описывающее, как переместился контент и куда он попадёт между двумя исходными кадрами, — и используют эту оценку движения для синтеза действительно нового промежуточного кадра, в котором каждый объект правильно расположен вдоль своей реальной траектории движения в эту дробную точку времени, вместо простого кросс-фейда или смешивания сырых значений пикселей между двумя кадрами, что даёт гораздо более плавное, естественное движение, особенно для быстро движущихся объектов или сложных перекрытий (объект ненадолго проходит за другим) — случаев, где наивное смешивание кадров создаёт очевидные, режущие глаз артефакты в стиле двойной экспозиции, которые сразу выглядят неправильно для зрителя. Почему это важно для SaaS-разработчиков: интерполяция кадров наиболее непосредственно актуальна как внутренний компонент конвейера инструментов синтеза видео на базе ИИ — многие модели текст-в-видео и синтеза видео нативно генерируют с более низкой частотой кадров (например, 8-16 кадров/с) по соображениям стоимости/скорости, а затем применяют интерполяцию кадров как более дешёвый постобработочный проход для достижения плавной, стандартной частоты доставки (24-60 кадров/с), вместо того чтобы генерировать каждый кадр напрямую гораздо более дорогой основной диффузионной моделью. Это также актуально для SaaS-продуктов реставрации/ремастеринга видео, повышающих частоту кадров старых архивных материалов для современных экранов, и для инструментов эффекта замедленной съёмки, которые интерполируют дополнительные кадры для плавного растягивания отснятого материала, а не просто замедляют существующие кадры (что выглядит рывками). Конкретный пример — оптимизированный по стоимости конвейер рендеринга платформы генерации видео на базе ИИ: (1) чтобы держать затраты на GPU под контролем, основная диффузионная модель видео генерирует клип с частотой 12 кадров/с; (2) вместо того чтобы платить намного более высокую стоимость вычислений за нативную генерацию на 24 кадрах/с, платформа прогоняет сырой вывод 12 кадров/с через модель интерполяции кадров, которая генерирует новый синтезированный кадр между каждой парой существующих кадров; (3) результат — плавное финальное видео на 24 кадрах/с за малую долю стоимости генерации нативных 24 кадров/с диффузией; (4) шаг интерполяции добавляет примерно 5-10 секунд обработки вместо удвоения стоимости основной генерации.

Похожие термины

Ещё термины: Вывод и медиа