Gemini научилась создавать и клонировать голоса
Google выкатила Gemini 3.8 Flash TTS и Flash-Lite TTS — две модели генерации речи, которые умеют лепить собственные голоса и клонировать их по короткой записи. Целятся они в аудиокниги, подкасты, игры, дубляж и голосовых ИИ-агентов.
Gemini 3.8 Flash TTS даёт задать голос персонажа текстом: роль, акцент и характеристики тянутся более чем на 100 языков и диалектов. В библиотеке — свыше 2000 готовых голосов, включая региональные варианты испанского, французского и английского.
Для клонирования хватит 30-секундной записи. Google уверяет, что функция задумана для своего голоса или того, на который есть разрешение. Система проверяет согласие владельца, а сгенерированное аудио прикрывают SynthID и метаданные C2PA.
Выбрав голос, можно крутить каждую реплику по отдельности: менять темп и манеру, добавлять шёпот, смех, вздохи и прочие реакции. Модели тянут и многочасовую генерацию, и диалоги двух персонажей разными голосами.
По данным Google, Flash TTS набрала 71,4 балла в Voice Design от Hume AI и 60,8 в тесте моделирования акцента. Flash TTS и Flash-Lite TTS заняли первое и второе места в Overall Quality Index.
Обе модели уже доступны в Google AI Studio и через Gemini API. Интеграцию анонсировали Agora, LiveKit, Pipecat и Vercel. Flash-Lite TTS при этом нацелена на масштабную генерацию аудио и работу голосовых ИИ-агентов.
—
Телеграм про право в IT и AI. IT юристы — PravoWeb.com