Яндекс научил голосовые устройства запоминать новые команды без потери старых

Исследователи Яндекса нашли способ обновлять распознавание голосовых команд так, чтобы умные устройства не забывали уже знакомые фразы. Подход может пригодиться колонкам, автомобильным ассистентам и другой технике, где и память, и вычислительные ресурсы быстро упираются в предел.
Метод приняли к публикации на Interspeech 2026 — одной из главных конференций по речевым технологиям. Она пройдёт в Сиднее с 27 сентября по 1 октября, а сама проблема для отрасли давно знакома: модель дообучают новым командам, и старые после этого начинают распознаваться хуже.
Яндекс пошёл не через полное переобучение, а через отдельный обучаемый модуль. Основная нейросеть остаётся на месте, а новые команды подхватывает дополнительный слой, который не трогает уже настроенные параметры системы.
Для умных колонок это понятно. Но не только для них. В автомобилях, телевизорах и бытовой технике голосовые помощники часто работают на устройстве с небольшим запасом памяти, так что лишние мегабайты и лишняя нагрузка там чувствуются сразу.
Результаты теста Google Speech Commands
Новый подход проверили на открытом наборе Google Speech Commands, который часто используют для оценки моделей распознавания коротких голосовых фраз. По данным исследователей, доля пропущенных новых команд снизилась до 4,37%.
Для сравнения, сопоставимая модель ошибалась чаще — 6,46%. А традиционное полное дообучение, как это обычно и бывает в таких задачах, ухудшало распознавание уже известных команд.
Отдельный модуль увеличил размер системы меньше чем на 10%. Для голосовых устройств это заметно спокойнее, чем раздувать модель после каждой новой команды или сценария, особенно если устройство должно работать локально и отвечать без облака.
Проблема катастрофического забывания давно известна и за пределами голосовых интерфейсов. С ней сталкиваются почти все системы, которые учатся последовательно: новые данные подтягивают свежие сценарии, но старые проседают. Поэтому компании, делающие ставку на on-device ИИ, ищут способы обновлять модели без полной перестройки архитектуры.
Для Яндекса такой подход означает более частые обновления голосовых сценариев без риска сломать базовые команды — вроде включения музыки, ответа на вопрос или управления умным домом. Локальные модели, похоже, будут играть всё большую роль: они позволяют добавлять больше функций в устройство, не упираясь в задержки и память.



