Революция в создании контента: Veo 3 генерирует диалоги и звуковые эффекты

Google представил Veo 3 — новейшую модель генерации видео, которую заслуженно можно назвать настоящим прорывом в этой области. Главная особенность этой технологии — полноценная поддержка звука. Если раньше генеративные видео были преимущественно немыми или требовали отдельной обработки аудио, то теперь система создаёт видео со звуковыми эффектами, фоновыми шумами и даже полноценными диалогами между персонажами.

Пользователи могут давать Veo 3 запрос с описанием персонажей и окружения, а также предлагать диалоги с указанием, как именно они должны звучать. Как отметил во время пресс-брифинга Демис Хассабис, генеральный директор Google DeepMind, цитирую — «Впервые мы выходим из немой эры видеогенерации».

Я в приятном шоке! Уникальность Veo 3 заключается в его способности понимать исходные пиксели из сгенерированных видео и автоматически синхронизировать с ними созданные звуки. Хотя инструменты для генерации звука на основе искусственного интеллекта не новы, именно такая интеграция видео и аудио выделяет разработку Google среди конкурентов.

На рынке уже существует множество инструментов для генерации видео от таких компаний как Runway, Lightricks, Genmo, Pika, Higgsfield, Kling, Luma, а также OpenAI и Alibaba. Однако возможность автоматической генерации синхронизированного звука даёт Veo 3 серьёзное конкурентное преимущество.

Новая технология будет доступна пользователям через приложение Gemini, предположительно по подписке.

Кажется, что Veo 3 — это полноценный переход от разрозненного подхода к генерации медиаконтента, где видео и аудио создавались отдельно, к интегрированной модели создания полноценного аудиовизуального контента с синхронизированными звуками, диалогами и изображением. Что радикально упрощает рабочий процесс создания видео. Браво.