
Google представила модель искусственного интеллекта Gemini 3.5 Transcribe для обработки голосового ввода. Она должна преобразовывать речь в готовый текст, убирая слова-паразиты, паузы и исправления говорящего. Модель уже используется в функции Rambler на смартфонах Pixel 11 и в дальнейшем появится в других сервисах Google.
Компания заявила, что Gemini 3.5 Transcribe работает примерно на 70% быстрее прежней системы распознавания речи Chirp 3. Уровень ошибок при обработке речи в реальном времени, по оценке Google, сократился с 7,32% до 5,5%. О новой разработке сообщило издание Ars Technica.
Новая модель распознаёт не только отдельные слова, но и пытается передать смысл сказанного в более связной форме. Во время диктовки она может удалять «э-э» и другие речевые запинки, а также учитывать исправления, внесённые пользователем по ходу фразы. Кроме того, система поддерживает пользовательский словарь для специальной терминологии.
Gemini 3.5 Transcribe работает с 85 языками и способна обрабатывать заранее записанный звук с участием до 3 человек. При этом применение такой функции предполагает, что искусственный интеллект будет самостоятельно менять формулировки для очистки текста. Для коротких сообщений это может помочь устранить оговорки и неточности, однако такой подход подходит не для всех случаев.








