
Компания Figure представила нейросеть Helix 2.5 для гуманоидных роботов. По словам разработчиков, модель обучили на данных о действиях людей. Она смогла выполнять бытовые задачи в 30 незнакомых домах в районе залива Сан-Франциско без сбора данных, дообучения или адаптации в этих помещениях.
В испытаниях робот с Helix 2.5 убирал гостиные, складывал полотенца и застилал кровати. Ему требовалось самостоятельно передвигаться по тесным комнатам, находить нужные предметы, менять положение корпуса и работать обеими руками. Мебель, планировка и объекты в тестовых домах не встречались системе во время подготовки.
Figure называет эксперимент первой демонстрацией zero-shot-обобщения для гуманоидного робота в таком масштабе. Термин zero-shot здесь означает, что модель не получала данных ни из домов, где проходила проверка, ни об используемых там игрушках, полотенцах и постельных принадлежностях. При этом сами типы задач система изучала по материалам, собранным в других местах.
Для эксперимента Figure взяла единую базовую модель, предварительно обученную на наборе данных Index. В компании описывают Index как крупный массив записей человеческого поведения. На его основе подготовили три отдельных поведения: уборку гостиной, складывание полотенец и застилание кровати. Одна базовая нейросеть должна была управлять перемещением, захватом жёстких и мягких предметов, зрительным восприятием и действиями двумя руками.
Условия успеха заранее зафиксировали для всех 30 домов. При уборке гостиной робот должен был собрать в корзину все разбросанные игрушки — от 13 до 15 штук. При работе с полотенцами требовалось сложить и убрать в корзину каждое из них. Во время застилания кровати система должна была положить обе подушки в верхнюю треть кровати, подтянуть углы одеяла к изголовью и разгладить его.
Частичный результат не засчитывался. Например, при уборке гостиной нужно было завершить работу со всеми игрушками. Если робот складывал полотенце, но не мог положить его в корзину, попытку считали неудачной. Во всех домах использовали один и тот же зафиксированный вариант модели, не меняя её параметры после тестовых заездов.
Figure также сравнила две версии политики управления, обученные на одинаковых данных для конкретной задачи. Одна начинала обучение со случайных параметров, другая получила предварительное обучение на Index. В слепой оценке вариант без предобучения успешно завершил 9% попыток, а модель на базе Index — 56%. Архитектура, параметры оптимизации, дальнейшее обучение и методика проверки в этом сравнении не менялись.
Компания также сообщает, что Helix 2.5 умеет исправлять ошибки во время длинных действий. Робот может отступить, изменить стойку или обойти кровать с другой стороны, если прежнее движение не помогло поправить одеяло. Figure связывает восстановление после ошибок с предварительным обучением на Index.
Figure сопоставила Helix 2.5 с одной из политик предыдущей системы Helix 02, которую обучали той же задаче. Helix 02 использовала данные, собранные непосредственно в среде последующей проверки. По данным компании, Helix 2.5 достигла такой же успешности, задействовав вдвое меньше данных для адаптации поведения. При этом новая модель проходила испытания сразу в 30 ранее не виденных домах.
Предыдущая версия Helix 02 уже демонстрировала автономные действия всем телом, включая разгрузку посудомоечной машины и логистическую задачу длительностью 200 часов. Однако для таких систем данные собирали в местах последующей работы роботов. Helix 2.5 создавали для переноса уже изученного поведения в новую обстановку.
Разработчики также изучили, как объём набора Index влияет на предсказание следующих действий робота. Они обучили четыре модели на вложенных подвыборках, отличавшихся по размеру в восемь раз. Размер модели и последующее обучение для конкретной задачи оставались одинаковыми. С каждой двойной прибавкой данных ошибка снижалась предсказуемо, а результат крупнейшего запуска удалось спрогнозировать до четырёх знаков после запятой ещё до обучения.
Погрешность такого прогноза составила 0,54% от разброса результатов на всём восьмикратном диапазоне данных. Figure называет это первым измерением закона масштабирования переноса навыков от человека к гуманоидному роботу. Эксперимент оценивал влияние только объёма данных, не меняя размер модели или параметры дальнейшего обучения.
Сейчас Index пополняется примерно 35 минутами нового человеческого опыта каждую секунду, сообщили в Figure. Компания также заявила о планах направить на обучение Helix вычислительные ресурсы стоимостью $3,5 млрд.