Tencent открыла исходный код HunyuanPortrait для анимации фотографий

Компания Tencent опубликовала исходный код и весовые коэффициенты своего проекта HunyuanPortrait – системы создания реалистичных анимированных портретов. Это решение, основанное на диффузионных моделях, позволяет переносить движения с исходного видео на статичное изображение, фактически «оживляя» фотографии с впечатляющей степенью реалистичности.

Техническая архитектура HunyuanPortrait представляет собой комплексный ансамбль специализированных моделей. SVD для генерации видеопоследовательностей. DiNOv2 для извлечения визуальных признаков. Arc2Face для работы с лицевыми выражениями. И YoloFace для надёжного обнаружения лиц. Такая многокомпонентная структура обеспечивает более точный контроль над анимацией и плавность переходов между кадрами по сравнению с существующими аналогами.

Текущая реализация требует 24 гигабайт видеопамяти для запуска процесса инференса, что делает технологию доступной для относительно широкого круга энтузиастов и профессионалов, имеющих в распоряжении современные графические ускорители. Важно отметить, что система пока не поддерживает режим «text-to-motion», ограничиваясь переносом движений с референсного видео.

Открытый доступ к коду и весам модели открывает новую главу в развитии технологий цифровой анимации, потенциально демократизируя инструменты, ранее доступные лишь крупным студиям и технологическим гигантам.