ElevenLabs научила ИИ говорить почти неотличимо от человека
Скоро по голосу нельзя будет понять, кто говорит — человек или нейросеть? ElevenLabs выкатила Eleven v4 — речевую модель, которая учитывает не только текст, но и тон, темп, эмоции, характер и контекст высказывания.
Разработчики уверяют, что новая система лучше слушается пользователя. Тегами можно задать нужную манеру речи или подкинуть звуковой эффект — скажем, смех или телефонный звонок. Фраза прозвучит драматично, ласково или комично, а модель при этом старается сберечь индивидуальные черты голоса.
Но на этом в компании не остановились. Eleven v4 и её низколатентная версия Eleven v4 Turbo тянут больше 90 языков, а сама модель должна держать единый голос персонажа даже в длинных диалогах, аудиокнигах и рекламе.
Отдельно обновили клонирование голоса. Теперь, по данным ElevenLabs, для копии хватит всего 10 секунд записи — и результат разработчики называют более аутентичным.
Модели уже доступны через ElevenAgents и API. В ElevenCreative их можно гонять в разделе Text to Speech, в том числе без подписки: сервис даёт 10 тысяч бесплатных кредитов в месяц.
В итоге речь ИИ всё меньше смахивает на механическое чтение текста. Рынку это сулит более реалистичных голосовых агентов и новые форматы аудиоконтента, где грань между синтетической и человеческой речью станет ещё тоньше.
Телеграм про право в IT и AI. IT юристы — PravoWeb.com