Перейти к содержимому
SBER 279,88 ₽ 0,02% снижениеIMOEX 2 264,06 0,91% снижение
·Технологии·16 сентября 2026 г.·1 мин

Google выкатила Gemini 3.8 Live и версию с рассуждениями

Google выкатила Gemini 3.8 Live и версию с рассуждениями

15 сентября Google представила две нативные speech-to-speech модели, Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Первая заточена под масштаб и цену, вторая — под многошаговые задачи с рассуждением прямо в диалоге.

Интереснее баллов то, что голосовые агенты наконец получили признаки продакшен-продукта. Асинхронные вызовы функций, предсказуемая цена, интеграции с тем, на чем такие системы реально собирают.

Хочу напомнить, как это делалось раньше. Голосовой бот — конвейер из трех сервисов. Распознавание речи, языковая модель и синтез. Задержки складываются, а вместе с текстом может потеряться все остальное — интонация, скорость речи, эмоция, шум на фоне. Модель получает расшифровку и не знает, что собеседник злится. Проблемным было и перебивание. Пока распознавание не закрыло фразу, система вообще не понимает, что ее прервали. Нативная speech-to-speech модель работает с аудио напрямую и снимает оба ограничения разом.

Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.

Habr

GOOGL29 дн. 0,4%
$342,87