Microsoft сжала модель для Copilot на 80% для запуска на устройстве

До конца октября в GitHub Copilot появится новая схема распределения задач, в том числе для запуска без облачных вычислений.

Лайнер с неоновыми линиями и моделью Microsoft Copilot

Разработчики смогут доверить выбор самому помощнику или указать модель вручную. Microsoft также подготовила версию модели для программирования, рассчитанную на запуск на устройстве.

Сейчас GitHub предлагает модели разных разработчиков и работает над Project HydraFusion, который выбирает одну или несколько моделей для задачи с учётом производительности, стоимости и задержки. Новая схема добавит к этому выбору место выполнения: устройство разработчика или облако. В автоматическом режиме Copilot будет переключаться между ними без необходимости настраивать распределение задач вручную. Во время продолжительного сеанса он сможет учитывать контекст задачи и состояние кеша, чтобы сохранять уже обработанную полезную информацию.

Оба способа выбора модели появятся в интерфейсе командной строки GitHub Copilot CLI, приложении Copilot и редакторе VS Code. При ручной настройке можно выбрать локальную модель MAI Code 1.1 Flash через Windows ML либо подключить Copilot к совместимому с OpenAI локальному интерфейсу и использовать доступные через него модели. При этом локальная обработка запросов не означает, что весь сеанс проходит без подключения к сети: выполнение команд и доступ к ресурсам регулируются отдельно.

Для работы на устройстве Microsoft AI адаптировала MAI Code 1.1 Flash, модель для задач программирования с 137 млрд параметров в общей сложности и 6,8 млрд активных параметров. Её первая версия предназначена для Surface Laptop Ultra на базе Nvidia RTX Spark. У устройства до 128 ГБ общей памяти, доступной процессору и графическому ускорителю, и до 1 петафлопса производительности в задачах ИИ. Но всю память модель занять не может: она нужна также системе, приложениям, среде выполнения и кешу, который растёт по мере обработки контекста.

График decode throughput для Microsoft Copilot модель
Источник изображения: neowin

Microsoft уменьшила объём локальной версии модели с помощью квантования и ускорила генерацию текста методом спекулятивного декодирования. Квантованная модель занимает 53 ГБ, что на 80% меньше облачной версии в формате Bfloat16. По результатам испытаний Microsoft, локальная версия набрала 70,8% на SWE-Bench Verified против 72,6% у облачной. При длине контекста 256 тысяч токенов пиковое потребление памяти составило 75,5 ГБ. Компания предупреждает, что скорость работы зависит от устройства, его конфигурации и нагрузки.

Для команд, которые запускает ИИ-агент, GitHub Copilot использует изоляцию на основе открытой библиотеки Microsoft Execution Containers. Она ограничивает доступ к файлам, сети, учётным данным и системным возможностям независимо от того, где работает модель. В Windows для этого применяется механизм BaseContainer, в macOS используется Seatbelt, а в Linux — bubblewrap. Настройки изоляции можно менять командой /sandbox в GitHub Copilot CLI.

Источники: Microsoft, Neowin
Елизавета Добровольская
Автор itzine.ru с 2021 года. Пишет о смартфонах, гаджетах, железе, искусственном интеллекте и космосе — в общем, обо всём, что есть в мире технологий. От новостей о складных флагманах и процессорах до репортажей о культуре и рынке электромобилей. Следит за индустрией внимательно, но без фанатизма.

Оставить комментарий