VLOGGER: новый ИИ Google оживляет людей на фотографиях

18:42 / 19 марта, 2024

Компания представила систему для мгновенного создания видео с говорящими людьми.

Google представила ИИ-модель VLOGGER, которая позволяет генерировать видеоролики с говорящими людьми на основе одного изображения человека и аудиофайла.

Новый метод стал возможен благодаря использованию генеративных диффузионных моделей, что отличает VLOGGER от предыдущих разработок. Метод не требует индивидуального обучения для каждого человека и способен работать без обнаружения и обрезки лиц, генерируя полные изображения, включая лицо и туловище, в различных сценариях.

Система VLOGGER работает в два этапа:

первый этап принимает в качестве входных данных форму аудиосигнала для создания промежуточных элементов управления движением тела, которые отвечают за взгляд, мимику и позу;
второй этап представляет собой временную модель преобразования image-to-image, которая предсказывает дальнейшие движения тела для генерации соответствующих кадров. Чтобы привязать процесс к определенной личности, VLOGGER также использует эталонное изображение человека.

Особое внимание уделено разнообразию и реалистичности генерируемых видео. VLOGGER способен создавать видео с интенсивным движением и высоким уровнем детализации, сохраняя при этом идентичность и временную последовательность. Модель была обучена на новом масштабном наборе данных MENTOR, который включает 2200 часов видео и 800000 личностей, что в 10 раз больше, чем предыдущие наборы данных.

VLOGGER находит применение в ряде областей, включая редактирование видео и создание видео с говорящими людьми на основе одного входного изображения и аудио. Модель может использоваться для редактирования существующих видео, изменяя выражение лица субъекта, например, закрывая рот или глаза, а также для адаптации видео под новые аудиодорожки на разных языках, обеспечивая согласованность движения губ и лица с новым аудио.

Хватит тратить время на ручные проверки и «накликивание»!

12 февраля на бесплатном вебинаре Security Vision покажем, как SGRC-подход создаёт «живую» безопасность. Меняем формальный контроль на стратегию вместе.

Регистрируйтесь!

Реклама. 18+ ООО «Интеллектуальная безопасность», ИНН 7719435412

Слив засчитан

VLOGGER: новый ИИ Google оживляет людей на фотографиях

Хватит тратить время на ручные проверки и «накликивание»!

Подпишитесь на email рассылку