
Meta* представила Muse Voice Transcribe, свой первый модельный продукт для обработки звука в реальном времени. Компания встроила его в Meta* AI для Mac, Muse Code и Meta* Model API, а на Mac он позволяет диктовать в любое приложение через клавишу Fn.
В Meta* Superintelligence Labs называют Muse Voice Transcribe первым real-time audio perception model в линейке компании. Он совмещает потоковую расшифровку речи, разделение говорящих и определение окончания фразы, а также умеет работать с несколькими языками и переключением между ними в одном разговоре. Ранее Meta* запустила Mac-приложение для своего AI-чатбота.
Модель обучали на более чем 70 языках, при этом 25 из них Meta* выделяет как проверенные для стартового релиза. Система также поддерживает аудио длиннее часа и использует языковую, основную и контекстную настройку, чтобы точнее распознавать имена, термины и знакомые модели речи.
В основе Muse Voice Transcribe лежит потоковый ASR с аудиоблоками по 80 мс. Модель может либо продолжать слушать следующий фрагмент, либо сразу выдавать текст, а для диаризации и определения окончания речи Meta* добавляет отдельные специальные токены.
Компания говорит, что Muse Voice Transcribe занимает первое место в Artificial Analysis по потоковой расшифровке речи и по открытым бенчмаркам для диаризации. В релизе Meta* указывает, что данные по включению модели и рейтингам актуальны на 1 сентября 2026 года.
Доступ к Muse Voice Transcribe уже открыт через Meta* Model API, Meta* AI for Mac и Muse Code. На Mac достаточно удерживать Fn, чтобы начать диктовку в любом приложении.
* Принадлежит компании Meta, она признана экстремистской организацией в РФ и её деятельность запрещена.