Распознавание речи Microsoft: 60 языков и задержка более 100 мс
Microsoft представила MAI-Transcribe-2-Streaming для приложений, которым нужен текст во время разговора.

Компания заявляет, что модель заняла первое место в рейтинге Artificial Analysis по точности промежуточных и окончательных расшифровок. Разработчики могут использовать её для субтитров, диктовки и голосовых агентов.
MAI-Transcribe-2-Streaming начинает показывать предварительный текст чуть более чем через 100 мс после получения звука. Ей не нужно ждать, пока человек закончит фразу: по мере поступления речи модель уточняет слова, а затем закрепляет окончательный вариант. Голосовой агент может начать обрабатывать запрос или обращаться к инструментам ещё до конца реплики пользователя. Субтитры появляются по ходу разговора.
Модель работает с 60 языками и автоматически определяет язык на протяжении разговора. В собственных испытаниях Microsoft для диктовки и субтитров слова появлялись на экране вдвое быстрее, чем при использовании ближайшего конкурента. Это оценка самой компании; отдельно она ссылается на рейтинг Artificial Analysis, где сравнивается точность промежуточного и окончательного текста. Microsoft также сообщает, что модель вошла в число решений с лучшим сочетанием точности и задержки в оценке сервиса.
Вместе с моделью расшифровки Microsoft анонсировала две модели для преобразования текста в речь: MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Компания предлагает сочетать их с MAI-Transcribe-2-Streaming при создании голосовых агентов, которые слушают собеседника и отвечают ему. MAI-Voice-2.1 поддерживает 23 языка и 26 региональных вариантов. По заявлению Microsoft, один и тот же синтезированный голос может переходить между языками, сохраняя узнаваемое звучание и подстраивая произношение.
Версия Flash поддерживает те же языки и рассчитана на большой объём запросов при низкой задержке. Microsoft указывает, что она может создать 45 секунд аудио с задержкой около 150 мс от начала до конца обработки. По оценке компании, обработка у Flash на 55% быстрее, а стоимость примерно на 60% ниже, чем у сопоставимых моделей. Обе речевые модели умеют клонировать голос по нескольким секундам образца; для этой функции предусмотрены ограничения, связанные с согласием владельца голоса.
Вводная цена MAI-Transcribe-2-Streaming составляет $0,54 (около 45 ₽) за час аудио и действует до конца 2026 года. MAI-Voice-2.1 стоит $22 (около 1800 ₽) за миллион символов, а MAI-Voice-2.1-Flash обойдётся в $15 (около 1200 ₽) за такой же объём. Microsoft также собрала демонстрацию Chatter в сервисе MAI Playground, чтобы показать совместную работу моделей в голосовом агенте.


