Главное Авторские колонки Пресс-релизы Промо Вакансии Вопросы
arrow-right Created with Sketch. Беличенко Виктория 376 0 В избр. Сохранено
Авторизуйтесь
Вход с паролем

Google представила новую модель распознавания речи

Компания Google выпустила модель Gemini 3.5 Transcribe для преобразования речи в текст. Она работает как с заранее записанным аудио, так и в режиме реального времени с задержкой менее секунды.

Модель умеет разделять говорящих, ставить временные метки и переключаться между языками прямо во время разговора.

Главное отличие новой системы заключается в том, что она автоматически очищает речь. Модель убирает слова-паразиты вроде «э-э», учитывает исправления говорящего на ходу и может сразу выдавать оформленный текст. Google продвигает её прежде всего как основу для голосовых агентов, а не просто как сервис для расшифровки диктофонных записей.

На многоязычном тесте FLEURS компания заявляет об ошибке распознавания около 5 %. Время до окончательной транскрипции, по данным Artificial Analysis, сократилось примерно на 70% по сравнению с предыдущим решением Chirp 3. Впрочем, это тестовые показатели. Реальное качество в условиях шумной кухни, на производстве или на совещании с плохими микрофонами может сильно отличаться.

Голосовые интерфейсы десятилетиями уступали клавиатуре по простой причине: человеку приходилось говорить так, чтобы его понял компьютер. Теперь подход меняется. Система сама начинает разбираться в паузах, оговорках и исправлениях. Если голос действительно станет надежным входным каналом для агентов, это окажется важнее очередной функции для диктовки сообщений.

0
В избр. Сохранено
Авторизуйтесь
Вход с паролем