Google представила голосовой ИИ нового поколения
Разговор с ИИ постепенно перестаёт быть обменом короткими репликами. Google представила модели Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, которые могут поддерживать естественный диалог, одновременно выполнять задачи и использовать внешние инструменты, не заставляя пользователя ждать.
Модели работают в формате speech-to-speech, понимают изображения и видео в реальном времени и поддерживают более 97 языков. Во время общения ИИ способен вызывать API и запускать операции в фоне, пока человек продолжает говорить.
Самое интересное появилось в версии Gemini 3.8 Live Extended Thinking. Эта модель умеет параллельно рассуждать над сложной задачей и вести диалог, сообщая о промежуточных результатах. По данным Google, в рейтинге Artificial Analysis Speech-to-Speech Quality Index она получила 82,6 балла и заняла первое место.
Новые модели уже доступны через Gemini API и Google AI Studio. Кроме того, компания начала внедрять их в Search, Gemini и Workspace, постепенно превращая голосовое взаимодействие в часть повседневных сервисов.
Google также раскрыла стоимость Live API: $0,005 за минуту входящего аудио и $0,018 за минуту исходящего. В пересчёте на токены это около $3 за миллион входных и $12 за миллион выходных аудиотокенов.
Похоже, голосовые ИИ-системы переходят на новый уровень, где модель не просто отвечает на вопросы, а одновременно слушает, анализирует и выполняет действия. Для бизнеса это может открыть путь к более естественным цифровым помощникам и новым форматам сервисов.
—
Реально интересный телеграм про право в сфере IT и AI.
Защита инвестора, например Проверка покупаемого бизнеса