Нейросети и ИИ

Nvidia показала AVO: агент прошёл ARC-AGI-3 без инструкций

Мужчина в чёрной майке демонстрирует усовершенствованный AI агент Nvidia AVO
Image Credits: Nvidia

Nvidia опубликовала исследование, в котором показала, что для длинных автономных задач решающим оказывается не только сам ИИ-модельный блок, но и вся обвязка вокруг него. Система Agentic Variation Operators, или AVO, на benchmark ARC-AGI-3 получила 100,00 RHAE и прошла все 183 уровня в 25 публичных средах.

Диаграмма AVO Nvidia показала График агентов
Источник изображения: techcrunch

Nvidia описывает AVO как общий агентный стек для кодинга и других задач, где нужно не один раз сгенерировать ответ, а долго сохранять ход работы. В компании отмечают, что агент умеет просматривать и править код, запускать команды, сверяться с документацией и проверять результат через выполнение.

В исследовании отдельно показан пример с оптимизацией GPU-ядра. В этом тесте AVO работала семь дней подряд, изучила более 500 направлений оптимизации и сохранила 40 версий ядра. На системах NVIDIA DGX B200 многоголовочные attention-ядра опередили cuDNN до 3,5%, а FlashAttention-4 — до 10,5% на проверенных конфигурациях.

Затем тот же подход перенесли на ARC-AGI-3. Там агенту дают незнакомые интерактивные среды без инструкций, правил и заранее сформулированной цели, а результат считают по метрике RHAE, которая совмещает прохождение уровней и эффективность действий по сравнению с человеческим базисом.

Как работает AVO

По словам Nvidia, AVO строится вокруг двух вещей: постоянной памяти и надзора. Память сохраняет прежние реализации, результаты проверок, выводы компилятора и профилировщика, а также накопленные рассуждения, чтобы агент мог продолжать с текущего состояния, а не начинать поиск заново.

Надзор нужен, чтобы отслеживать общую траекторию работы. Если поиск буксует или повторяет бесполезные циклы, supervisor может направить основной агент на другой путь. В семидневном прогоне по оптимизации ядра именно основной агент решал, что проверять, менять, тестировать и оценивать, а supervisor помогал удерживать движение вперёд, когда поиск заходил в плато.

Для ARC-AGI-3 Nvidia использовала ту же архитектуру, но подключила её к другому интерфейсу задач. Агент работал в текстовом режиме: каждое наблюдение подавалось как точная текстовая сетка 64 на 64, без изображений и без image-токенов. При этом правила и цели ему не объясняли, а эффект действий приходилось выяснять через взаимодействие со средой.

В компании подчеркивают, что в полной публичной выборке AVO с Claude Opus 5 завершила все 25 сред и показала 100,00 RHAE, затратив 6 624 действия в среде. Для сравнения, в описании VISTA для той же выборки приводится 7 542 действия, то есть у AVO получилось примерно на 12% меньше.

Nvidia отдельно оговаривает, что это не контролируемая абляция: системы различаются по агентному блоку, представлению наблюдений, памяти, управлению контекстом и другим деталям. Компания также пишет, что результат связан не только с моделью, но и с тем, как полный стек агента помогает удерживать автономное действие.

В работе упоминается и ещё один тестовый прогон с GPT-5.6 Sol на сложной подвыборке игр. Там Sol в отдельных случаях быстрее достигал совпадающих уровней по стендовому времени, тогда как Opus в сопоставимых условиях использовал меньше действий в среде.

Для Nvidia это исследование стало проверкой не только ARC-AGI-3, но и самого подхода к агентам. В компании считают, что долгие задачи требуют не одной удачной генерации, а связки из памяти, инструментов, обратной связи и механизма восстановления, который позволяет продолжать работу после ошибок и тупиков.

Источники: Nvidia, Techcrunch
Елизавета Добровольская
Автор itzine.ru с 2021 года. Пишет о смартфонах, гаджетах, железе, искусственном интеллекте и космосе — в общем, обо всём, что есть в мире технологий. От новостей о складных флагманах и процессорах до репортажей о культуре и рынке электромобилей. Следит за индустрией внимательно, но без фанатизма.

Оставить комментарий