Перейти к содержимому
SBER 277,55 ₽ 0,29% ростIMOEX 2 257,98 0,88% снижение
·Технологии·27 августа 2026 г.·1 мин

Google выпустила модель распознавания речи, которая пытается понять не только слова, но и то, что человек хотел сказать

Google выпустила модель распознавания речи, которая пытается понять не только слова, но и то, что человек хотел сказать

Google представила Gemini 3.5 Transcribe — новую модель для преобразования речи в текст. Она работает как с заранее записанным аудио, так и в реальном времени с задержкой меньше секунды и умеет разделять говорящих, ставить временные метки и переключаться между языками прямо посреди разговора.

Интереснее обычной транскрипции то, что модель автоматически чистит речь: убирает «э-э», учитывает исправления человека на ходу и может сразу выдавать нормально оформленный текст. Google отдельно продвигает её как основу для голосовых агентов, а не просто сервис расшифровки диктофона.

На многоязычном тесте FLEURS Google заявляет ошибку распознавания около 5%, а время до окончательной транскрипции, по данным Artificial Analysis, сократилось примерно на 70% относительно предыдущего решения Chirp 3. Это всё же тестовые показатели, а качество на шумной кухне, производстве или совещании с плохими микрофонами может отличаться очень сильно.

Голосовые интерфейсы десятилетиями проигрывали клавиатуре по одной банальной причине: человеку приходилось говорить так, чтобы его понял компьютер. Сейчас направление разворачивается — система сама начинает разбираться в паузах, оговорках и исправлениях. И если голос действительно становится надёжным входом для агентов, это куда важнее очередной функции «надиктовать сообщение».

Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.

Habr

GOOGL25 дн. 2,1%
$355,28