Источник: technologyreview.com
Tesla Optimus — белый робот с чёрными головой и корпусом — регулярно появляется в видеороликах. Он танцует, передаёт попкорн, выбрасывает мусор, пылесосит и нажимает кнопку микроволновки. В других роликах Optimus падает, раздавая бутылки с водой, или с трудом гладит рубашку.
Глава Tesla Илон Маск считает Optimus одним из важнейших продуктов компании. По его словам, со временем робот обретёт ловкость на уровне человека, а затем и выше. Маск утверждает, что Optimus сможет выполнять почти любую работу — от переноски листового металла до складывания белья — и будет стоить около $20 000. На ежегодной встрече Всемирного экономического форума в Давосе, Швейцария, в январе он предположил, что робот поступит в продажу до конца 2027 года.
Маск не единственный, кто делает такие прогнозы. Марк Андриссен, сооснователь и генеральный партнёр венчурной фирмы Andreessen Horowitz из Кремниевой долины, заявил, что робототехника может стать крупнейшей отраслью в истории планеты. В январе глава Nvidia Дженсен Хуанг сказал, что в этом году гуманоидные роботы сравняются с людьми по способностям. Morgan Stanley прогнозирует, что к 2050 году число роботов, «похожих на людей и ведущих себя как люди», приблизится к миллиарду, а объём рынка превысит $5 трлн.
Эти заявления во многом опираются на предположение, что достижения ИИ, лежащие в основе ChatGPT от OpenAI и Claude от Anthropic, позволят роботам нового поколения подражать движениям людей так же, как чат-боты подражают человеческой речи. Многие исследователи робототехники сомневаются в этом: по их мнению, такое сравнение недооценивает трудности применения ИИ, обученного на языке и изображениях, к непредсказуемому физическому миру. Янн ЛеКун, которого часто называют одним из основателей современного ИИ, на другом мероприятии во время январской конференции в Давосе заявил, что компании, создающие гуманоидных роботов, пока не знают, как сделать их достаточно умными для практической пользы.

Илон Маск предсказывает, что гуманоидный робот Optimus от Tesla может стать одним из самых продаваемых продуктов в мире. Пока что чаще всего его можно увидеть раздающим еду и напитки на мероприятиях Tesla
Источник: technologyreview.com
Исследователи также предупреждают: гуманоидная форма и способность робота выполнять разные задачи — не одно и то же. Джонатан Хёрст, сооснователь и директор по робототехнике Agility Robotics, а также профессор робототехники Орегонского государственного университета, объясняет: сделать робота похожим на человека легко, а заставить его двигаться и вести себя так же динамично, как человек, намного сложнее.
Споры о том, появятся ли универсальные гуманоидные роботы в ближайшее время и хватит ли для их создания нынешних методов ИИ, идут в лабораториях по всей стране. Разговоры о сроках часто заслоняют кропотливый, но заметный прогресс.
Около десяти лет назад серия открытий привела к революции генеративного ИИ и воплотила давнюю мечту о практическом искусственном интеллекте. Исследователи робототехники, хотя и расходятся в оценках сроков, считают, что в этой области тоже возможен крупный прорыв: машины могут научиться лучше ориентироваться в физическом мире и двигаться плавнее. По мере развития робототехники остаётся открытым вопрос: достаточно ли методов и инструментов, которые помогли развитию ИИ, или нужен совершенно иной путь.
Роботы и передовой ИИ
Чтобы увидеть одну из самых развитых систем управления роботами, стоит посмотреть на Google DeepMind и устройство ALOHA 2. Его название расшифровывается как «недорогая система оборудования с открытым исходным кодом для двуручного телеуправления».
Исследователи давно спорят, нужна ли универсальному роботу человекоподобная форма. Сторонники считают, что так ему будет проще работать в мире, созданном для людей; противники не видят смысла в дополнительных сложностях. ALOHA 2 отражает второй подход. Устройство выглядит просто: пара рук, захваты и две камеры. Но исследователи Google DeepMind используют его как рабочую платформу для испытаний Gemini Robotics — своей передовой системы ИИ для робототехники — в разных лабораториях.
Под управлением Gemini Robotics ALOHA 2 может выполнять разные задачи, которым её обучили на примерах. Например, робот способен собрать ланчбокс: аккуратно положить кусок белого хлеба в пакет Ziploc и закрыть его, поместить виноград в контейнер Tupperware и закрепить крышку, убрать оба предмета в ланчбокс и застегнуть его.
Получается не лучший обед, но ещё три года назад робот не умел выполнять такую задачу. Это стало возможным во многом благодаря ИИ и новым системам управления роботами — политикам, которые определяют, как универсальный робот оценивает окружающую обстановку, планирует движения и выполняет задачу.
Новейшие модели ИИ для роботов от Google DeepMind становятся всё более ловкими, хотя и довольно медленными и непредсказуемыми
Источник: technologyreview.com
Раньше такие системы создавали инженеры: они вручную прописывали правила в программном обеспечении робота. Для этого могли потребоваться тысячи строк кода, задававших движения робота с точностью до миллиметра для сотен задач. В последние годы управление всё чаще передают продвинутым системам ИИ, а не задают в коде.
Сначала появились визуально-языковые модели — VLM. Как и большие языковые модели, они обрабатывают слова, но обучаются ещё и на изображениях. Если показать такой модели снимок пролитого кофе и попросить найти, чем вытереть пятно, она может указать на лежащую рядом тряпку. Несколько лет назад, когда правила управления роботами прописывали вручную, такое понимание контекста было недоступно.
Затем появились визуально-языковые модели действий — VLA, которые позволяют роботам оценивать обстановку и действовать. К изображениям и видео, связанным с задачей, добавляют данные о движениях роботизированной руки. Обычно их собирают с помощью телеуправления: человек управляет роботом дистанционно и показывает ему, что делать. Так ИИ учится управлять движениями робота. Если поставить перед таким роботом стол и попросить «закрыть ноутбук» или «смотать провод от наушников», он осмотрит сцену, найдёт нужный предмет, спланирует действие и начнёт двигаться — если раньше уже видел, как выполняется эта задача.
Gemini Robotics — модель VLA, обученная на множестве часов записей, где люди показывают самые разные действия. Она умеет выполнять сравнительно сложные задачи: поднимать сахарный горошек кухонными щипцами, складывать оригами или собирать простой обед. Но есть заметное ограничение: если роботу под управлением VLA поручить задачу, которой нет в обучающих данных, он, скорее всего, потерпит неудачу.
Эдвард Джонс, профессор робототехники в Имперском колледже Лондона, говорит, что по-настоящему универсальная система должна уметь выполнять задачи по всему спектру возможных действий. Сейчас Gemini Robotics умеет делать лишь несколько вещей здесь и несколько там.
В поисках универсальности
Как научить роботов большему числу задач? Самый очевидный ответ — добавить данных для обучения.
Логика такова: больше данных — больше примеров, а больше примеров — шире возможности робота. Google DeepMind, например, стремится собрать как можно больше данных, говорит Паннаг Санкети, бывший технический руководитель робототехнического направления компании, который теперь работает над собственным проектом в области робототехники и ИИ. Но найти подходящие данные непросто. Для обучения больших языковых моделей уже существовали огромные массивы текстов, а сопоставимого запаса качественных записей физических действий нет.
У исследователей есть несколько способов восполнить этот пробел, и у каждого свои недостатки:
Санкети считает, что наиболее перспективен комбинированный подход с данными из всех этих источников.
Но согласны с тем, что одних обучающих данных достаточно, не все. Хёрст из Agility называет эту идею в корне ошибочной.
Сложность в том, что реальные задачи быстро обрастают множеством деталей. Возьмём приготовление кофе: кухни отличаются друг от друга, кофемашины работают по-разному, для разных чашек нужны разные захваты, а с кофейными зёрнами, горячей водой и молоком надо обращаться по-разному. Даже такая простая задача требует учитывать постоянно меняющиеся условия. По мнению Хёрста, чтобы научить роботов справляться с этим при помощи VLA, понадобятся данные обо всём, что робот вообще способен сделать, — то есть почти бесконечный объём примеров.
ЛеКун отвергает этот подход. На конференции в Давосе он заявил, что методы ИИ, эффективные для языка, не подходят для многомерных, непрерывных и зашумлённых данных, с которыми роботы постоянно сталкиваются. По его словам, здесь нужен другой подход.
Главный кандидат на эту роль — так называемые модели мира. Их обучают не столько на текстах, сколько на видео, трёхмерных сканах и данных с датчиков, чтобы они могли предсказывать последствия действий в реальном мире. Задача — создать модели с достаточно точным внутренним представлением реальности: как объекты движутся, сталкиваются, падают и деформируются. Если роботов удастся обучать в симуляциях, точно отражающих физику реального мира, разработка станет быстрее, дешевле и безопаснее, а потребность в испытаниях вне симуляции снизится. Кроме того, модели мира могут помочь роботам рассуждать об окружающей обстановке, а не только реагировать на неё, и предвидеть последствия действий.
Над этой технологией работают Nvidia и Google, а инвесторы вкладывают деньги в известные стартапы. World Labs, соосновательницей которой стала исследовательница ИИ из Стэнфорда Фэй-Фэй Ли, привлекла $1 млрд в феврале, а в конце сентября AMD приобрела компанию за $8,2 млрд. AMI Labs, основанная, в частности, ЛеКуном — бывшим главным исследователем ИИ в Meta, — привлекла $1 млрд в марте.
Однако, как признают сами участники отрасли, работа только начинается. В конце прошлого года Ли назвала эту область молодой и сказала, что базовые подходы ещё формируются. В июне в рассылке на Substack она описала серьёзные трудности. Пока модели мира — перспективное направление исследований, но не готовый путь к универсальным роботам. И всё же первые признаки их возможностей уже появляются.
Один из таких сигналов — небольшой, но потенциально важный шаг, сделанный в апреле в лаборатории робототехники Сан-Франциско.
Прорыв?
В районе Мишн в Сан-Франциско стартап Physical Intelligence — или PI, как он себя называет, отсылая к числу π, — разрабатывает универсальный «мозг», который теоретически сможет превратить любой робот в универсального помощника. Компания обучает роботов, используя самые разные источники данных, и недавно заметила, на что может быть способен роботизированный «мозг» с моделью мира.
В 2024 году PI рассказала о своей первой универсальной системе для робототехники π0 — модели VLA, которую компания назвала самой способной и ловкой универсальной системой управления роботами на тот момент. Сначала её обучали на собственной базе из 10 000 часов записей действий людей, собранных с помощью телеуправления, а также на нескольких открытых наборах данных о роботах. Весной 2025 года вышла версия π0.5: её обучили на более разнообразных данных, включая размеченные изображения из интернета, что расширило возможности модели. В обновлении π0.6, вышедшем осенью 2025 года, добавили обучение с подкреплением.

Как научить робота пользоваться ножом? В стартапе Physical Intelligence начинают с разработки подходящей архитектуры ИИ, в которой есть компоненты, отвечающие за язык, зрение и движения. Это поможет роботу соотносить команды — «эй, робот, нарежь мои овощи!» — с соответствующими действиями
Источник: technologyreview.com

Данные для обучения ИИ могут поступать из многих источников, но один из важнейших — демонстрации человека. Сотрудник стартапа управляет рукой робота дистанционно, показывая ИИ, как нарезать цукини
Источник: technologyreview.com

Исследователи обучают модель ИИ на сотнях примеров демонстраций человека, а также на изображениях из интернета и видео от первого лица
Источник: technologyreview.com

После обучения ИИ команда предлагает ему незнакомую задачу, например нарезать эту тыкву-горлянку. Если робот раньше не сталкивался с такой задачей, он может задуматься, жёлтый ли это цукини или необычный банан, и ошибиться. Но эти ошибки можно использовать, чтобы доработать модель
Источник: technologyreview.com
Каждое обновление улучшало работу модели. Она научилась складывать бельё — сначала медленно, — убирать вещи в незнакомой обстановке и чаще успешно выполнять задачи вроде складывания коробок. Затем в апреле 2026 года версия π0.7, похоже, вывела PI на новый уровень. В ней используется менее мощная модель мира, которая создаёт изображения необходимых для задачи этапов. Пока робот работает, эта облегчённая модель показывает ему снимки следующего действия.
Компания утверждает, что модель впервые демонстрирует признаки композиционного обобщения: способности выполнять незнакомые задачи, комбинируя навыки, на которых ИИ обучался раньше. В одном испытании модель попросили «положить батат в аэрогриль» — такой задачи она раньше не встречала. В ролике робот немного мечется, несколько раз начинает заново и в итоге делает разумную попытку, хотя полностью не справляется.
Сергей Левин, профессор Калифорнийского университета в Беркли и сооснователь PI, воодушевлён результатом. По его словам, модель впервые убедительно показала, что может сделать приемлемую попытку выполнить задачу, для которой исследователи специально не собирали данные и не обучали её.
После этого команда решила выяснить, как модели удалось справиться. В обучающих данных нашлись отдельные размеченные записи телеуправления, относящиеся к аэрогрилю. Среди них было два примера, в которых человек управлял роботом и задвигал корзину аэрогриля внутрь. Возможно, этих фрагментов оказалось достаточно, чтобы π0.7 почти смогла приготовить батат в аэрогриле.
Пока неясно, насколько хорошо π0.7 умеет обобщать навыки. Но модель лишь мельком сталкивалась с аэрогрилем, и этот результат показывает, чего уже способны добиться передовые исследования.
Источник: technologyreview.com
Источник: technologyreview.com
«Успех в 70% случаев — это провал»
В лабораториях роботы продвигаются небольшими шагами: например, учатся класть батат в аэрогриль. На сценах и в роликах всё выглядит иначе: роботы танцуют и вежливо разносят напитки. Но такие демки часто не показывают, что происходит за кадром: во многих случаях роботом управляет человек или его действия тщательно спланированы заранее. Например, роботом, который в марте 2025 года вышел на сцену вместе с главой Nvidia Дженсеном Хуангом, реагировал на его команды и ходил за ним, дистанционно управлял человек — «кукловод за кулисами», как назвали его создатели.
Источник: technologyreview.com
Автономное планирование движений, при котором робот сам понимает, куда ему двигаться, пока остаётся нерешённой задачей. Особенно трудно научить его ориентироваться в незнакомой и хаотичной обстановке — например, на стройке или в незнакомом доме. Ещё сложнее поручить роботу большую и неоднозначную работу, которая состоит из нескольких задач и требует решить, что и в каком порядке делать. Одно дело — положить тарелку в микроволновку, другое — выполнить просьбу «приготовь ужин»: осмотреть холодильник, нарезать ингредиенты и включить плиту. Лучшие попытки Google DeepMind приблизиться к такой задаче пока не увенчались успехом: робот должен был осмотреть кухню и собрать в корзину все ингредиенты для грибного ризотто.
Источник: technologyreview.com
Кроме того, практический робот должен справляться с задачей почти каждый раз. Основатель Boston Dynamics Марк Райберт говорит, что успех в 70% случаев обычно считают большим достижением, если до этого показатель был 50%. Но для практического применения 70% — это всё равно неудача.
Немногие гуманоидные роботы, которых испытывают в реальных условиях, выполняют очень ограниченные задачи в тщательно контролируемой среде. До универсальности им далеко. По данным Agility, сотни её роботов проходят испытания на объектах GXO Logistics, Amazon и Schaeffler. Пока они выполняют простые задачи — например, перемещают контейнеры и ящики. Хёрст добавляет, что компания потратила годы на создание роботов, достаточно безопасных для того, чтобы логистические фирмы вообще задумались об их использовании.
В мае 2025 года Маск заявил, что к концу года на заводах Tesla будут работать тысячи роботов Optimus. Однако в январе этого года он сказал, что некоторые из них уже выполняют на заводе простые задачи.
Хотя гуманоиды начинают появляться на заводах, перейти к работе в домах будет ещё сложнее. Уже сейчас можно предзаказать домашнего робота 1X Neo: ожидается, что поставки начнутся позже в этом году. За $20 000 он обещает выполнять «скучные и рутинные дела по дому» — убирать посуду, открывать дверь и наводить порядок в гостиной, чтобы человек мог сосредоточиться на том, что для него важно.
В будущем робот ростом пять футов и шесть дюймов должен будет выполнять эти задачи самостоятельно. Пока же для большинства действий ему нужен оператор-человек, который управляет им дистанционно. Да, чтобы заглянуть в дом через камеры робота, оператору понадобится разрешение. На вопрос, когда появятся полностью автономные роботы для домашних дел, Хёрст ответил, что, если ему нужно назвать срок, он предположил бы, что на это уйдёт десять лет.
Когда это произойдёт, роботы вполне могут оказаться китайскими: Китай значительно опережает Запад по объёмам производства. По данным аналитической компании Omdia и китайской робототехнической фирмы Unitree, в 2025 году китайские компании выпустили почти 90% из примерно 15 000 поставленных гуманоидных роботов. Модель Unitree — компании, которая в прошлом году поставила больше гуманоидных роботов, чем любой другой производитель, — стоит меньше $6 000. Низкая цена может сделать роботов привлекательнее для покупателей, хотя Unitree сначала рассчитывает продавать их для промышленного применения. AP недавно сообщило, что китайских роботов заказывают преимущественно корпоративные и университетские лаборатории, а также государственные предприятия.
Эта история уже повторялась
Мечта о создании человекоподобного робота существует давно. Ещё в 1495 году Леонардо да Винчи набросал чертёж механического рыцаря, которым управляли бы тросы и блоки. В XX веке появлялись и исчезали машины, словно сошедшие с экранов научной фантастики.
В 1939 году на Всемирной выставке в Нью-Йорке показали Elektro — семифутового робота Westinghouse, похожего на коробку на ногах. Он курил сигарету. В 1973 году университет Васэда в Японии создал WABOT-1 — первого полноразмерного программируемого человекоподобного робота. ASIMO от Honda, представленный в 2000 году, стал, вероятно, первым таким роботом, который показал хоть какие-то практические способности: он мог подниматься по ступеням, узнавать лица и самостоятельно передвигаться в пространстве. Но в 2018 году проект закрыли: робот так и не вышел за пределы того, что умел показывать на демках, и не стал полезным в реальной работе.
Все эти машины в своё время были впечатляющими инженерными достижениями. Но ни одна не была готова к самостоятельной работе в реальном мире. Современные роботы, даже с возможностями передового ИИ, сталкиваются с той же принципиальной проблемой.
Демонстрации часто создают впечатление, что роботы полезны, но машины всё ещё ошибаются слишком часто, чтобы их можно было надёжно использовать дома и на фабриках
Источник: technologyreview.com
Читайте также
Co-op Legal Services оценивает с помощью ИИ звонки сотрудников клиентам
Microsoft выпускает новые ИИ-ПК на чипах Nvidia с обновлённой Windows 11
Healthleap привлекла $38 млн на ИИ-платформу, которая выявляет пациентов, требующих внимания врачей
Завышенная оценка Firmus может снизиться перед ожидаемым выходом на ASX
Стартап Mecka AI привлёк от Sequoia $60 млн на данные для роботов
Всегда ли лучшая работа означает, что и специалисты стали лучше?
Nous Research подтвердила оценку в $1,5 млрд и запустила ИИ-агентов для бизнеса
Финляндия требует от Google остановить строительство новых дата-центров после того, как подрядчики вырубили охраняемые леса
Тони Фаделл — о провале первой волны ИИ-гаджетов и о том, что будет дальше
Meta отказывается удалять ИИ-видео с жестоким насилием над детьми в Facebook — в том числе ролик, где младенца жарят в духовке
Машины, которые собирают машины
Meta выпустила Muse на iPad всего через месяц после выхода мобильной версии
Mumsnet отрицает, что использует ИИ для создания контента, после появления промта на форуме
Эти исследователи научили ИИ довезти Toyota Corolla до In-N-Out
Biohub Цукерберга возглавила программу на $1,8 млрд по созданию ИИ-моделей, предсказывающих поведение клеток
ChatGPT снабжает сгенерированные комиксы подписями настоящих карикатуристов
Anthropic выпустила Claude Haiku 5.5, снизив цену API на 90% до уровня GPT-6 Luna
Смогут ли фильмы о Цукерберге, Маске и Альтмане поколебать веру в техногигантов?
Новый ChatGPT больше показывает, чем рассказывает
Google рассчитывает превратить обычных игроков в разработчиков игр с помощью новой функции Playground на базе Gemini
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram