i
Новости
Новости · 2026-10-07

Машины, которые собирают машины

@neuronium_ai @neuronium_ai

NVIDIA Seattle Robotics Lab и инженерная команда NVIDIA Isaac разработали роботизированные системы для сборки тестовых лотков GB300. Они автоматизировали две операции: установку токоведущей шины с 16 винтами и подключение четырёх кабелей. Сборка шины удаётся более чем в 95% случаев, но занимает 160 секунд при целевом времени 124 секунды. Подключение кабелей занимает в среднем 40 секунд на каждый, а успешность составляет 90–95%. В работе пригодились классические методы планирования и управления, оценка позы DOPER, обучение с подкреплением и специальные детали захватов.

Обложка: Машины, которые собирают машины

Чип NVIDIA Grace Blackwell GB300 используют для обучения и инференса передовых моделей. Но сборка тестовых лотков, которые проверяют работоспособность и производительность вычислительных модулей перед отправкой и установкой, требует квалифицированного ручного труда. NVIDIA Seattle Robotics Lab (SRL) вместе с инженерной командой NVIDIA Isaac проверяла, смогут ли интеллектуальные роботы справиться с этой задачей.

Сможет — но путь оказался непростым. За девять лет работы SRL сборка лотков GB300 стала одной из самых трудных задач лаборатории. Она также заставила пересмотреть представления о том, где лучше работают сквозное обучение и модульные системы.

Рабочие устанавливают несколько разъёмов

Источник: developer.nvidia.com

Две задачи сборки

SRL сосредоточилась на сборке тестовых лотков GB300. По рекомендации операционной команды NVIDIA и Foxconn, контрактного производителя GB300, команда выбрала две важные операции: установку токоведущей шины и подключение нескольких разъёмов.

При сборке шины нужно захватить длинную тяжёлую металлическую деталь, которая передаёт большой ток, перенести её на лоток, установить и закрепить 16 винтами. Также требуется установить и снять приспособления и зажимы. При подключении разъёмов нужно поднять с лотка два больших и два маленьких электрических разъёма на кабелях и вставить их в тесные гнёзда.

Источник: developer.nvidia.com

Заводские специалисты выполняют обе операции уверенно и плавно, не прилагая значительных умственных усилий. Но, как и в других примерах парадокса Моравека, автоматизировать задачи, требующие ловкости, оказалось очень сложно.

Первое препятствие — неопределённость. Точная геометрия, внешний вид и динамика деталей заранее неизвестны, а их начальное положение может сильно различаться. Электрические разъёмы соединены с кабелями, которые деформируются по всей длине, заметно различаются из-за особенностей производства и меняют механические свойства вследствие пластической деформации и усталости материала.

Во многих производственных процессах неопределённость снижают за счёт жёсткой автоматизации и контроля среды. Приспособления и переходники фиксируют детали с точностью до долей миллиметра, а роботам остаётся повторять заданные движения. Для сборки тестовых лотков GB300 нужна гибкая автоматизация: из-за быстрого изменения конструкции и небольших объёмов производства жёсткая автоматизация не подходит. Роботы должны самостоятельно подстраиваться к неопределённости и устойчиво работать в меняющихся условиях. По мнению NVIDIA, растущий спрос на ИИ-инфраструктуру делает этот подход стратегически важным.

Второе препятствие — производительность. В исследованиях по робототехнике успешность в 50–60% часто считают приемлемой, а показателя 80–90% иногда хватает, чтобы объявить задачу решённой. При этом время цикла, плавность движений и бережное обращение с деталями нередко отходят на второй план. Статистическая проверка также бывает недостаточной: на задачу часто проводят лишь 10–20 испытаний, хотя для приемлемых доверительных интервалов может потребоваться гораздо больше.

Целевые показатели команда определила вместе с операционной командой NVIDIA и Foxconn, чтобы под решением задачи понимался именно нужный производству результат. На момент публикации команда быстро приближалась к этим требованиям.

Демонстрация человеком того, что должно выполнять наше роботизированное решение при сборке токовой шины и установке нескольких разъёмов. Эти этапы немного отличаются от тех, которые выполняют работники Foxconn (показаны в видео 1 и 2); роботизированному решению не нужен большой защитный кронштейн, а завинчивание можно выполнить за один этап

Источник: developer.nvidia.com

Подход: выбирать метод под задачу

В робототехнических исследованиях высоко ценят техническую новизну. Это стимулирует изобретения, но почти не побуждает улучшать базовые методы, которые могут дать более высокую производительность. Поэтому из научной статьи бывает трудно понять, почему прежние подходы не сработали.

Для сборки лотков GB300 команда выбирала метод под конкретную задачу. Сначала для каждой части работы рассматривали и обычно реализовывали классические базовые решения. Если они не справлялись, переходили к обучению на примерах, обучению с подкреплением в симуляции с переносом в реальный мир, обучению с подкреплением на реальном оборудовании и моделям «зрение — язык — действие». Такое сравнение позволило выявить преимущества и ограничения каждого подхода и понять, где оправданы новые методы и дополнительная сложность.

Далее команда подробно разбирает установку шины и подключение нескольких разъёмов как примеры для исследовательских и инженерных групп, которые решают задачи манипуляции в реальных условиях.

Наше решение для сборки токовой шины. Один манипулятор Flexiv устанавливает камеру для оценки позы. Второй манипулятор Flexiv устанавливает ограничительный фиксатор и токовую шину (с прикреплённым зажимом). Манипулятор UR с помощью отвёртки OnRobot Screwdriver прикручивает токовую шину к лотку. Затем второй манипулятор Flexiv снимает зажим токовой шины и ограничительный фиксатор

Источник: developer.nvidia.com

Сборка шины: классические методы

Сборка шины состоит из пяти шагов:

1Захватить ограничительное приспособление — деталь, помогающую при сборке, — и установить его в лоток.
2Захватить шину с установленным зажимом и поместить её в лоток.
3Закрепить шину в лотке 16 винтами.
4Отсоединить и снять зажим с шины.
5Убрать ограничительное приспособление.

Начальные условия соответствовали производственным: приспособление и шина с зажимом лежали в произвольных местах на ровной поверхности рядом с роботом, а винты находились внутри шины.

Производители потребовали успешности не ниже 99,5% и времени выполнения не более чем вдвое дольше, чем у квалифицированных работников: в данном случае — не более 124 секунд. Любые случайные столкновения с лотком были недопустимы, поскольку даже небольшое повреждение могло привести к списанию всей системы.

Сначала команда создала классический пайплайн с отдельными модулями восприятия, планирования и управления, рассчитывая позднее перейти к сквозному обучению. Однако классический пайплайн оказался достаточно эффективным, и переход не потребовался. Модульную систему было проще отлаживать и настраивать, а её компоненты — распределять между роботизированными манипуляторами.

Для восприятия сначала применяли NVIDIA FoundationPose — универсальную модель, которая оценивает шестимерную позу объекта по его трёхмерной модели, цветному изображению RGB и карте глубины. Если объект был виден недостаточно хорошо, ошибка оценки могла достигать 90 или 180 градусов. Команда добавила обработку нескольких ракурсов: система оценивала позу для каждого вида и выбирала вариант с более высокой уверенностью. Это помогло снизить число ошибок. Позднее команда перешла на специализированную модель DOPER, о которой рассказывает дальше.

Для планирования команда использовала быстрый планировщик промежуточных точек в свободном пространстве, чтобы сократить время цикла. Чтобы выравнивать детали, изначально лежащие неровно, применяли манипуляционные движения по кривым Лиссажу и другим простым траекториям.

Для управления разработали высокопроизводительный импедансный контроллер. Он обеспечивал мягкий и устойчивый контакт, сохраняя достаточное усилие при установке деталей. Многие современные пайплайны обучения используют максимально простые контроллеры, тогда как в этом решении применили автоматический подбор демпфирования и компенсацию инерции. В NVIDIA считают высокопроизводительное управление полезным, но недостаточно востребованным инструментом обучения роботов.

Чтобы сократить время цикла, работу распределили между тремя манипуляторами. Один Flexiv Rizon 4S устанавливал камеру для оценки позы. Второй Flexiv Rizon 4S ставил ограничительное приспособление и шину, а затем снимал зажим и приспособление. Universal Robots UR10e с отвёрткой OnRobot выполнял все 16 операций с винтами. По согласованию с производителем зажим шины немного изменили, чтобы один манипулятор мог расфиксировать его.

Успешность сборки шины превысила 95%; команда продолжает её повышать. Большинство оставшихся ошибок связано с захватом и проскальзыванием детали в захвате во время установки. Операции с ограничительным приспособлением и шиной укладывались в целевое время, но завинчивание — нет. Полный цикл занимал 160 секунд при целевом показателе 124 секунды. Основное узкое место — последовательная работа с конкретной отвёрткой; команда считает, что этот участок можно оптимизировать.

Вид сверху на экспериментальную установку в реальных условиях

Вид сверху на экспериментальную установку в реальных условиях

Источник: developer.nvidia.com

Квалифицированные рабочие на заводе Foxconn выполняют сборку токовой шины

Источник: developer.nvidia.com

Некоторые из наших робототехнических сервисов

Источник: developer.nvidia.com

Инфраструктура для робототехники

Для сложных задач вроде установки шины качественная инфраструктура робототехники помогла команде быстро разрабатывать, внедрять и проверять системы в реальных условиях.

Пять подэтапов сборки токовой шины. Ключевые детали на каждом этапе обведены красным

Пять подэтапов сборки токовой шины. Ключевые детали на каждом этапе обведены красным

Источник: developer.nvidia.com

Первый важный компонент — робототехнические сервисы. Работа с несколькими библиотеками часто заканчивается конфликтами зависимостей. Команда упаковывает библиотеки в независимо развёртываемые веб-сервисы, которые работают на периферийных устройствах, внутри предприятия или в облаке. Сервисы поставляются в контейнерах Docker с интерфейсами FastAPI и HTTP. Исследователи могут соединять сервисы, написанные на разных языках и с использованием разных фреймворков, через лёгкий клиент на Python. Среди используемых сервисов — cuRobo для планирования движений, FoundationPose для оценки позы и FoundationStereo для оценки глубины.

Второй компонент — система управления жизненным циклом задач и агентов TALOS. Она построена на ros2_control и включает планировщики движений, манипуляционные процедуры и высокопроизводительные контроллеры импеданса, адмиттанса и усилия. Библиотека позволяет объединять эти компоненты и обученные политики в последовательности, а также исполнять контроллеры в циклах реального времени с частотой выше 500 Гц. TALOS поддерживает Franka FR3, Flexiv Rizon 4S, Universal Robots UR10e и SO-101. Команда использует её во всех своих проектах с реальными роботами, включая обучение движением, телеуправление, координацию двух рук и планирование движений.

Доступ к TALOS также можно получить через стандартные веб-интерфейсы. Поэтому агенты для программирования могут обращаться к робототехническим сервисам и физическим роботам, соединяя возможности восприятия, планирования и управления как при разработке, так и при внедрении. Такой подход соответствует стандарту Model Hardware Standard (MHS) от Anthropic — не привязанной к конкретной модели спецификации, которая помогает агентам обнаруживать физические устройства и безопасно управлять ими. Открытый проект DROID+ показывает, как это можно реализовать.

Используя робототехническую инфраструктуру и наработки по сборке шины, команда перешла ко второй задаче — подключению нескольких разъёмов.

Примеры применения TALO S

Источник: developer.nvidia.com

Подключение разъёмов: обратный урок горечи

Подключение состоит из трёх шагов, которые нужно выполнить для каждого электрического разъёма — двух больших и двух маленьких:

Источник: developer.nvidia.com

Источник: developer.nvidia.com

Захватить кабель и поднять его, чтобы приподнять электрический разъём над платой.
Захватить разъём на конце кабеля.
Вставить разъём в соответствующее гнездо на плате.

Начальные условия снова соответствовали производственным. Все четыре кабеля были подключены одним концом к плате GB300, не были сильно спутаны, а разъёмы на кабелях могли лежать в произвольных местах платы.

Производители потребовали успешности не ниже 99,5% и времени не более чем вдвое дольше, чем у квалифицированных работников: не более 72 секунд на все четыре кабеля. Как и при сборке шины, случайные столкновения с лотком не допускались.

Описать задачу просто, но выполнить её трудно по трём причинам: кабели имеют неровную форму, подвержены пластической деформации и износу; разъёмы маленькие и почти лишены текстуры; зазоры между разъёмами и гнёздами малы, поэтому ошибка может сорвать установку.

Сначала команда снова реализовала классический пайплайн. Чтобы захватить кабель, она использовала модель сегментации Segment Anything Model (SAM3), выделявшую кабели в заранее заданной области изображения RGB, снятого сверху. По маске рассчитывалась центральная линия кабеля. Робот захватывал её середину на заданной высоте и поднимал кабель, открывая разъём.

Этот простой метод почти не давал сбоев.

[Слева] Видео с первым набором универсальных пальцев захвата. Эти пальцы рассчитаны на отклонения от заданной позы перед захватом и направляют детали в повторяемое положение после захвата. В первом видео пальцы захвата берут небольшой разъём MCIO. Во втором видео тот же набор пальцев захвата берёт крупный разъём DC-SCI

Источник: developer.nvidia.com

Второй набор универсальных пальцев захвата. Они предназначены для захвата (слева направо) приспособления, ручки токовой шины, механизма разблокировки зажима токовой шины и кабелей

Второй набор универсальных пальцев захвата. Они предназначены для захвата (слева направо) приспособления, ручки токовой шины, механизма разблокировки зажима токовой шины и кабелей

Источник: developer.nvidia.com

Захватывать открывшиеся разъёмы было гораздо труднее. Универсальная модель плохо справлялась с оценкой их позы: разъёмы маленькие, лишены выраженной текстуры, а место крепления к кабелю меняется. Из-за этого возникали большие ошибки, и планирование движений и захвата становилось ненадёжным. Команда перешла к обучению восприятия и управления захватом в рамках одной модели.

Этот путь тоже не привёл к результату. Обучение с имитацией на основе трансформеров с разбиением действий на фрагменты (ACT) и политики диффузии показывали низкую успешность. Им нужны большие объёмы качественных данных, которые было трудно собрать. Форма и жёсткость кабелей заметно различались, а специализированных кабелей было мало. Каждый из них можно было захватывать и перемещать лишь ограниченное число раз: затем он необратимо деформировался и переставал соответствовать условиям эксплуатации.

Команда назвала это «обратным уроком горечи»: в некоторых задачах реального мира накопить данные в большом масштабе невозможно из-за физических, финансовых и логистических ограничений. Поэтому снова становятся интересны классические методы, которые используют знания о предметной области и требуют меньше данных взаимодействия.

Команда вернулась к оценке позы, но изменила требования: модель должна специализироваться на нужных деталях, не зависеть от точной или характерной текстуры и быстро улучшаться на данных из реального мира. Вместе с коллегами из NVIDIA Research она разработала фреймворк восприятия Deep Object Pose Estimation Revisited (DOPER). Он основан на работе NVIDIA Deep Object Pose Estimation (DOPE), одной из первых публикаций об использовании масштабных синтетических данных для восприятия объектов в реальном мире.

Сначала модель DOPER обучают в симуляции. В неё загружают трёхмерную модель конкретной детали, затем создают изображения RGB с разных ракурсов и автоматически размечают ключевые точки. Для этого применяют выборку наиболее удалённых друг от друга точек на выпуклой оболочке детали, а затем отбирают точки с учётом видимости и заметности. После этого компактная быстрая свёрточная сеть учится предсказывать по изображениям RGB ограничивающие рамки, маски сегментации и разметку ключевых точек.

В реальном мире создают нейронную трёхмерную реконструкцию детали. Предварительно обученную модель DOPER запускают на её изображениях с разных ракурсов и случайным фоном, чтобы получить псевдоразметку. Предсказания с низкой уверенностью исправляют, проецируя на нужный ракурс предсказания с высокой уверенностью.

Затем DOPER дообучают на этой разметке. При работе в сцене модель предсказывает ключевые точки, по которым рассчитывается поза детали. Обработка идёт с частотой камеры — 30 Гц или выше.

Исходные условия, типы разъёмов и конечное положение при установке нескольких разъёмов. Целевые гнёзда слева обведены красным; разъёмы MCIO выделены зелёным, разъёмы DC-SCI — красным

Исходные условия, типы разъёмов и конечное положение при установке нескольких разъёмов. Целевые гнёзда слева обведены красным; разъёмы MCIO выделены зелёным, разъёмы DC-SCI — красным

Источник: developer.nvidia.com

DOPER вернул команде уверенность в оценке позы. Фреймворк позволил обучить точные модели для конкретных разъёмов и запускать их в реальном времени. Полученные оценки помогали одному манипулятору поворачивать и перемещать каждый разъём в положение, из которого второй манипулятор мог надёжно его захватить.

Повторное применение нашего метода захвата кабелей

Источник: developer.nvidia.com

Механика помогает снизить неопределённость

Как отмечалось выше, быстрые изменения конструкции и небольшие объёмы производства требуют гибкой автоматизации: роботы должны подстраиваться к неопределённости в деталях и их положении. При этом гибкие системы тоже могут использовать приёмы жёсткой автоматизации — например, механические решения, снижающие неопределённость.

Исследователи-мехатроники, работающие с жёсткой автоматизацией, и специалисты по компьютерным наукам, занимающиеся гибкой автоматизацией, долго развивались отдельно. NVIDIA предлагает объединить аппаратное обеспечение, программное обеспечение и исследования в области ИИ в один комплексный подход.

При закрытии захвата контакт мог сдвинуть разъёмы в нежелательное или неустойчивое положение. Эту проблему можно решать с помощью тактильных датчиков, повторного захвата или манипуляций с деталью внутри захвата. Но в данном случае проще было усовершенствовать механическую конструкцию, что также позволяло сократить время цикла.

Команда разработала два набора универсальных пальцев для захватов. С их помощью роботы могли брать шину, ограничительное приспособление, кабели, а также большие и маленькие разъёмы.

Геометрия пальцев ограничивала движение деталей при контакте и делала положение захвата гораздо более повторяемым. Такие пальцы можно изготовить почти на любом любительском 3D-принтере.

[Слева] Пример изображения с камеры RealSense D405, закреплённой на запястье. [Справа] Сегментация SAM3 и выделенные центральные линии кабелей

[Слева] Пример изображения с камеры RealSense D405, закреплённой на запястье. [Справа] Сегментация SAM3 и выделенные центральные линии кабелей

Источник: developer.nvidia.com

Разъём после того, как его кабель захватили и приподняли. [Вставка] Вид с камеры RealSense D405, закреплённой на запястье. Аннотированы ограничивающая рамка разъёма, ключевые точки и 6D-поза, определённые DOPER

Разъём после того, как его кабель захватили и приподняли. [Вставка] Вид с камеры RealSense D405, закреплённой на запястье. Аннотированы ограничивающая рамка разъёма, ключевые точки и 6D-поза, определённые DOPER

Источник: developer.nvidia.com

Повторное применение нашего метода захвата разъёмов

Источник: developer.nvidia.com

Последний этап: контактная операция

После захвата каждого разъёма его нужно вставить в соответствующее гнездо на плате GB300. По сравнению с установкой шины эта операция сложнее из-за хрупких токопроводящих контактов, малого зазора и почти полного отсутствия направляющих поверхностей при соприкосновении деталей.

В таких условиях классические подходы часто работают плохо. Различия в геометрии гнёзд, накопление ошибок управления роботом или неверно выбранное усилие могут привести к тому, что разъём заклинит, не попадёт в гнездо или столкнётся с соседними компонентами. Податливые контроллеры полезны, но плохо переносят большие ошибки в пространственном положении и требуют отдельной настройки для каждой задачи.

Поэтому команда обратилась к обучаемым методам. Продолжая исследования переноса из симуляции в реальный мир (1, 2, 3, 4, 5), она использовала обучение с подкреплением без модели, чтобы обучить в NVIDIA Isaac Lab политики для установки электрических разъёмов из разных начальных положений. Затем политики перенесли на реальные роботы.

Источник: developer.nvidia.com

В симуляции обучение политик установки разъёмов параллельно шло на стендах Isaac Lab. Слева показаны частично обученные политики для разъёмов DC-SCI и MCIO, справа — полностью обученные.

Перенос из симуляции дал высокую успешность при установке большого разъёма в реальных условиях, но хуже сработал с маленьким. Политики использовали оценки позы, и даже небольшая ошибка могла заставить разъём соскользнуть по краю гнезда. Надёжность установки большого разъёма также оставалась ниже промышленного уровня. Команда пришла к выводу, что данные из реального мира незаменимы.

Большинство систем, предназначенных для реального применения, должны обеспечивать оптимальную производительность: например, максимальную надёжность и скорость или минимальное число вмешательств человека. Симуляция всегда будет отличаться от реального мира, поэтому обученные в ней политики могут оказаться не оптимальными. В реальных условиях системы могут улучшаться на данных, собранных непосредственно при взаимодействии с окружающей средой.

Для доработки политик установки команда развила прежний метод SPARR. Сначала в симуляции обучают базовую политику, использующую состояние системы. Затем в реальном мире обучают политику-остаток, которая работает с изображениями. Результаты выполнения базовой политики помогают начать обучение на реальных данных и обеспечивают безопасное исследование вариантов. Во время установки разъёмы закрыты от камеры, поэтому политику-остаток обучали на показаниях датчиков силы и крутящего момента, а не на изображениях.

Итоговая система объединила методы захвата кабелей, захвата разъёмов и установки разъёмов и могла подключать все четыре кабеля от начала до конца. Успешность составила 90–95%. Большинство оставшихся ошибок связано с координацией манипуляторов при захвате разъёмов. В среднем на один кабель уходило 40 секунд. Основное узкое место — медленная последовательная настройка положения открытых разъёмов перед захватом. Показатели пока не соответствуют требованиям внедрения, и команда продолжает сокращать разрыв.

Источник: developer.nvidia.com

Источник: developer.nvidia.com

К чему ведёт автоматизация

Автоматизация производства и проверки систем GB300 и их преемников важна для NVIDIA и всей сферы ИИ: эти системы обеспечивают вычисления для передовых моделей. В более широком смысле интеллектуальная автоматизация, дополняющая труд квалифицированных специалистов, важна для местного производства. По прогнозу, к 2033 году в производстве останутся незаполненными 1,9 миллиона рабочих мест.

В перспективе роботизированная сборка оборудования для ИИ может привести к более масштабному сценарию: под контролем человека роботы с ИИ будут собирать оборудование для ИИ, на котором затем обучат следующее поколение таких роботов. Это может создать безопасный цикл развития.

Источник: developer.nvidia.com

Уроки проекта GB300

Работа над сборкой тестовых лотков GB300 стала для команды одним из самых полезных исследовательских проектов и подтвердила ценность исследований, ориентированных на конкретную задачу.

Создавать новые технические подходы без привязки к конкретному применению — распространённая и полезная практика: результаты могут пригодиться через несколько лет. Опыт сборки GB300 показал ценность и другого подхода: выбрать крайне трудную задачу с практической пользой, проверить на ней возможности и ограничения существующих методов и разрабатывать новые решения там, где готового пути нет.

Команда сформулировала семь технических выводов:

1Оценка позы может быть эффективной. В начале проекта команда не ожидала такого результата и не хотела, чтобы он оказался верным. Однако DOPER обеспечил быструю и точную оценку позы промышленных деталей. Для этого потребовалось изменить требования к методу: обучать специализированные модели, не полагаться на точные или характерные текстуры и быстро дообучать модели на данных из реального мира.
2Механическая конструкция помогает снизить неопределённость. Для специалистов по автоматизации это очевидно, но в исследованиях обучения роботов такой подход менее привычен. Печатные на 3D-принтере пальцы захвата помогли надёжно брать зажимы, кабели и приспособления, не усложняя систему тактильными датчиками, повторными захватами или манипуляциями внутри захвата. Робототехника объединяет разные уровни системы: хороший результат требует и вычислительного, и механического интеллекта.
3Высокопроизводительное управление нельзя упускать из виду. Исследователи десятилетиями разрабатывают высокопроизводительные контроллеры роботов, однако в большинстве работ по обучению роботов используют максимально простые законы управления. Контроллеры с автоматическим подбором демпфирования и компенсацией инерции помогают обеспечить плавное движение в свободном пространстве, мягкий и устойчивый контакт, а также повысить успешность и сократить время цикла поведения, обученного с подкреплением.
4Нужно изучать задачи, где объём данных ограничен. Урок горечи подтверждён большим количеством практических данных. Но в том, что команда называет «обратным уроком горечи», собрать данные в большом масштабе бывает невозможно: взаимодействий мало, детали сложно симулировать, замена обходится дорого, а многократное использование изнашивает объекты. Классические методы всё ещё могут быть эффективны, а исследования обучения — уделять больше внимания структуре задачи и эффективности использования данных.
5Время цикла важно не меньше успешности. Типичная система обучения робота может сочетать получение данных о движении с частотой 1 кГц, работу политики на частоте 100 Гц, поток камеры 30 Гц и управление захватом на частоте 5 Гц — и у каждого компонента свои требования к работе в реальном времени. Некоторые операции трудно или невозможно распараллелить. Ускорение должно сохранять точность управления и безопасность людей и роботов, а также предотвращать повреждение деталей. Время цикла и успешность следует считать одинаково важными показателями.
6Инфраструктура ускоряет разработку и внедрение. Робототехнические сервисы и TALOS помогли команде избежать конфликтов зависимостей, взаимозаменять планировщики и контроллеры и переносить код между роботами. Компании могут много инвестировать в инфраструктуру, тогда как исследовательские лаборатории обычно этого не делают. Общие инструменты, разработанные для исследований, могли бы ускорить прогресс в этой области.
7Важны и синтетические, и реальные данные. DOPER использовал большой объём синтетических данных для конкретных деталей, чтобы начать обучение. Для установки разъёмов применялось обучение с подкреплением в симуляции. Но данные из реального мира всё равно оказались необходимы. Промышленная робототехника предъявляет строгие требования к производительности, и сочетание синтетических и реальных данных помогает добиться практического результата.

Повторное применение нашего метода установки разъёмов. Действия базовой политики, обученной в симуляции, сочетаются с действиями остаточной политики, обученной в реальном мире

Источник: developer.nvidia.com

Как приблизить лабораторию к заводу

В робототехнике результат исследования определяется тем, удаётся ли применить его в реальном мире. Следующая цель команды — внедрить технологию на заводах, где контрактные производители NVIDIA выпускают оборудование для ИИ, и выполнить или превысить их требования к производительности. Это должно ускорить производство передовых вычислительных систем.

Однако внедрение связано с рядом проблем. Даже если робот хорошо работает в лабораторных испытаниях, как убедиться, что он справится перед запуском на производстве? На заводе будут другие условия окружающей среды и рабочей зоны. Несоответствие между средами — одна из распространённых слабостей роботов, обученных с помощью машинного обучения. Кроме того, конструкция выпускаемых изделий может меняться, а это ещё одно различие, которого лабораторные испытания не показывают.

Даже достаточно надёжную и гибкую систему нужно статистически проверить. Чтобы подтвердить вероятность успеха не ниже 99,5% с односторонней 95-процентной доверительной границей, необходимо провести не менее 598 испытаний без единого сбоя. Из-за износа деталей такие проверки могут потребовать сотни одинаковых компонентов GB300. Точное моделирование деталей со сложной геометрией и механическими свойствами остаётся открытой задачей, несмотря на недавние успехи в физической симуляции и интерактивных моделях мира.

NVIDIA предлагает ориентироваться на опыт отрасли автономных автомобилей. Там границы между обучением без движения автомобиля и его работой на дороге размыты: сначала люди внимательно следят за поведением автомобиля и исправляют его, но со временем он становится всё более автономным. Систему обучения робота тоже следует внедрять, даже если её работа пока не идеальна. Люди или агенты под контролем человека должны без затруднений записывать вмешательства, чтобы система могла постоянно улучшаться. Со временем наберётся достаточно данных, собранных в реальных условиях производства, чтобы статистически подтвердить качество работы.

Второй важный вопрос внедрения: как сделать так, чтобы следующую задачу было проще решать после того, как робот уже научился выполнять предыдущую? Здесь важны два понятия — обобщение и адаптивность.

Хорошее обобщение означает, что робот, обученный на наборе задач, может справиться и с новой. Если он умеет вставлять штифты в отверстия, собирать набор шестерён и затягивать винты, у него должны быть общие знания и ловкость, чтобы подключить кабель USB-C. Хорошая адаптивность означает, что робот умеет быстро осваивать задачу, которой раньше не знал. Например, если он может собирать шестерни с зазором 0,5 мм, то должен быстро научиться собирать их с зазором 0,1 мм.

Согласно распространённой в исследованиях точке зрения, долгосрочный путь к обобщению и адаптивности лежит через модели, обученные на данных масштаба интернета. Среди них — модели «зрение — язык — действие» (VLA), модели «мир — действие» (WAM) и специализированные базовые модели для робототехники. Они уже показывают признаки физического здравого смысла, быстрой адаптации и обучения в контексте.

Однако робототехнике ещё далеко до охвата почти бесконечного разнообразия физического мира и эффективного обучения на таких данных. Для сравнения: компания, разрабатывающая автономные автомобили, может собирать от 100 ТБ до 1 ПБ полезных данных в день, но вождение — всего лишь одна из задач, которые должен уметь решать универсальный робот. Кроме того, модульные системы в достаточно ограниченных условиях часто обобщают быстрее и лучше сквозных моделей (1, 2).

Команда выделяет три взаимодополняющих пути к обобщению и адаптивности в базовых моделях робототехники.

Первый — цикл постоянного улучшения данных: совершенствовать роботов в условиях эксплуатации, собирать данные при работе и использовать их для дополнительного обучения базовых моделей. Ограничение этого подхода — охват: каждое внедрение даёт узкий набор взаимодействий, поэтому базовым моделям может быть трудно обобщать между ситуациями.

Второй путь — модели мира. Если определить их как «мультимодальные модели предсказания, учитывающие действия», то обучать такие модели можно почти на любых данных о физическом мире. В будущем их, возможно, получится использовать как симуляторы любых физических взаимодействий и разнообразно дообучать с их помощью базовые модели робототехники. Однако модели мира должны меняться со временем: как уже отмечалось, динамика объектов может быть непостоянной.

Третий путь — робототехника под управлением агентов. Как показывают недавние исследования (1, 2, 3), агенты всё лучше рассуждают о пространстве и применяют человеческий здравый смысл, а также предлагают эффективные действия в симуляторах, моделях мира и реальном мире. Действия под руководством агентов могут создавать данные для дополнительного обучения, а такие агенты в будущем, возможно, заменят людей при исправлении поведения роботов на новых задачах.

NVIDIA призывает присоединиться к этой работе. Роботизированная сборка оборудования для ИИ — одна из значимых задач современности и ориентир для фундаментальных и прикладных исследований в робототехнике. Компания рассчитывает, что исследовательское сообщество будет быстро развивать это направление.

Наше решение для установки нескольких разъёмов. Один манипулятор Flexiv приподнимает целевой кабель, чтобы открыть разъём, и поворачивает его в положение, доступное второму манипулятору Flexiv. Второй манипулятор захватывает разъём и применяет обученную политику для установки разъёма в гнездо. Эта последовательность повторяется для каждого оставшегося кабеля

Источник: developer.nvidia.com

Что будет дальше

NVIDIA готовит технический отчёт с подробным описанием методов и последних экспериментальных результатов. Компания также работает над открытием для сообщества DOPER и TALOS, а вместе с инженерной командой NVIDIA Isaac — над типовыми сценариями для установки разъёмов.

Ссылки на материалы появятся в статье по мере их публикации.

Недавние эксперименты с GPT-6 Astra в обученной модели мира. Astra демонстрирует впечатляющее пространственное понимание и может управлять роботами в моделях мира, позволяя специалистам по робототехнике собирать большие объёмы ценных данных

Источник: developer.nvidia.com

Meta выпустила Muse на iPad всего через месяц после выхода мобильной версии Mumsnet отрицает, что использует ИИ для создания контента, после появления промта на форуме Эти исследователи научили ИИ довезти Toyota Corolla до In-N-Out Biohub Цукерберга возглавила программу на $1,8 млрд по созданию ИИ-моделей, предсказывающих поведение клеток ChatGPT снабжает сгенерированные комиксы подписями настоящих карикатуристов Anthropic выпустила Claude Haiku 5.5, снизив цену API на 90% до уровня GPT-6 Luna Смогут ли фильмы о Цукерберге, Маске и Альтмане поколебать веру в техногигантов? Новый ChatGPT больше показывает, чем рассказывает Google рассчитывает превратить обычных игроков в разработчиков игр с помощью новой функции Playground на базе Gemini Новый ИИ определяет по скану мозга, о чём вы думаете Meta внедряет ИИ-инструменты для поиска рекламы, скрытно ведущей к материалам о сексуальном насилии над детьми OpenAI запустила Decisions API: он сводит сложную оценку к ответу «да», «нет» или выбору одного варианта Мужчина признался, что ему стало стыдно, когда ИИ-агент выложил в рабочий Slack его банковские балансы и подробный список расходов Agent Lightning v1.0: лёгкий фреймворк для агентного обучения с подкреплением на 3 500 строк кода — с реальными агентскими пайплайнами Пентагон рассчитывает ускорить закупки ИИ для «цепочки поражения» с помощью пятиминутных видео Отставной полковник ВВС предупреждает: жизнь рядом с дата-центрами опасна — вас могут атаковать или убить Новый сайт Google распознаёт созданные ИИ изображения, видео и аудио с помощью SynthID Австралия строит всё больше жилья. Но не тормозит ли бум дата-центров стройку домов? Тэтчеризм через Walkman: культурологические исследования Стюарта Холла в Британии сохранили в цифровом архиве McDonald’s обвинили в нарушении антимонопольных законов из-за ИИ-инструмента для расчёта цен во франшизах

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram