
Яндекс подвёл итоги программы по оптимизации вычислительной инфраструктуры за первое полугодие 2026 года и сообщил, что сэкономил 9,2 млрд рублей. Высвободившиеся ресурсы компания направила на масштабирование разработки технологий искусственного интеллекта.
Один из главных ходов — динамическое перераспределение вычислительных ресурсов. Когда пользовательская нагрузка падает, свободные мощности автоматически уходят на другие задачи. Ночью, например, графические процессоры подключают к обучению новых моделей.
Сэкономить помогла и настройка моделей. Часть из них перевели на архитектуру MoE (Mixture of Experts, «смесь экспертов»): в обработке запроса участвует только нужный фрагмент нейросети. Плюс инженеры использовали обучение небольшой модели на базе уже готовой большой модели и квантизацию.
В инфраструктуре обучения и инференса ускорили загрузку данных, распараллелили вычисления, добавили кэширование повторяющихся операций и технологию EAGLE. Она ускоряет генерацию ответов за счёт прогнозирования нескольких следующих токенов.
Программа затронула не только мощности для искусственного интеллекта, но и остальные сервисы компании. На серверах с центральными процессорами, которые используются в поиске, рекомендациях и других высоконагруженных продуктах, применили PGO и BOLT. Эти технологии анализируют реальную нагрузку сервисов и помогают процессорам выполнять больше операций без роста используемых ресурсов.
Отдельно доработали хранение служебных данных. Яндекс пересмотрел правила на всех этапах жизненного цикла данных, убрал лишние дубли, протестировал новые алгоритмы сжатия и внедрил инструменты для поиска неиспользуемых таблиц, полей и резервных копий. Заодно оптимизировали и сам расклад данных между HDD, SSD и другими типами хранилищ.
Проект ведут инженеры бизнес-группы Поисковых сервисов и ИИ вместе с командой внутренней инфраструктуры Яндекса. Изменения внедряют во всех продуктах через единую ML-платформу, которая ведёт весь цикл работы с моделями: от обучения до эксплуатации.