Несмотря на годы разработки и огромные расходы на обучение сложных систем, беспилотные машины по-прежнему теряются перед сравнительно простыми препятствиями. Они неожиданно останавливаются посреди шоссе, врезаются в дорожные барьеры, не справляются с ограждениями на стройках и заезжают в затопленные участки.
Проверить, справятся ли с этим передовые ИИ-модели, решили три компьютерных учёных. Они встроили в систему управления Toyota Corolla GPT-6 Astra от OpenAI, Grok 4.6 от xAI и Claude Fable 5.1 от Anthropic и проверили, смогут ли модели проехать круг по трассе на парковке.
Как устроили DrivingBench
В проекте DrivingBench использовали подключённый к интернету ноутбук и устройство «comma four», соединённое с системами управления Toyota. Модели передавали ноутбуку команды, опираясь на данные GPS и показатели состояния автомобиля — например, угол поворота руля и колёс, которые поступали с «comma four».
Исследователи дали ChatGPT, Claude и Grok управлять настоящей Toyota Corolla — рулём, газом и тормозами. Человек не вёл машину, но держал ногу над педалью тормоза.
Результаты заездов
Результаты оказались неодинаковыми. Только GPT-6 Astra смогла полностью пройти трассу — со второй попытки за пять минут. При этом машина проехала меньше 500 футов. Остальные модели справлялись хуже: большинство попыток заканчивалось до первого поворота.
Исследователи объяснили частые неудачи проблемой восприятия: модели неправильно определяли, с какой стороны от первого диагонального ряда конусов проходит полоса. После первой попытки Grok пожаловалась, что машина шире, чем кажется по изображению с камеры: прямо перед автомобилем не было свободной полосы — там находились клумба, стена или ближайший красный конус.
Тем не менее это первая успешная попытка исследователей заставить такие модели управлять машиной. До этого они несколько раз проводили испытания с более ранними поколениями передовых моделей. По выводу команды, теперь модели способны вести настоящие автомобили на достаточно низкой скорости. Увиденный результат их удивил и обнадёжил, но одновременно показал, что нужно срочно продолжать работу над безопасностью, согласованием поведения моделей и оценкой их возможностей.
За полностью завершённый раунд команда заплатила 7,74 доллара за 6,6 миллиона токенов инференса. Это показывает, сколько вычислений потребовалось модели OpenAI, чтобы обработать данные, хотя автомобиль двигался всего со скоростью 0,94 мили в час.
Машина проехала меньше 500 футов, поэтому даже такие расходы быстро накапливаются. По расчётам The Register, стоимость токенов оказалась примерно в 500 раз выше стоимости топлива для автомобиля с расходом 25 миль на галлон при цене бензина 4,60 доллара за галлон.
Модели отказывались садиться за руль
Некоторые модели предупреждали исследователей, что не смогут безопасно управлять Toyota. Поэтому учёным пришлось убеждать их вообще принять управление. В отчёте говорится, что некоторые модели, особенно GPT-6 Astra, время от времени отказывались вести автомобиль, ссылаясь на соображения безопасности. Это случалось даже на совершенно пустой парковке, несмотря на перечисленные исследователями меры предосторожности, очень низкое ограничение скорости и готовность человека нажать на тормоз.
Команда пробовала менять промты, чтобы модели соглашались управлять машиной стабильнее. Например, исследователи называли происходящее «симуляцией». Но в некоторых испытаниях модели видели настоящие изображения, понимали, что автомобиль реальный, и начинали тревожиться.
Передовые модели, доступные без специальной доработки, пока явно не готовы возить людей на работу. С учётом возможных последствий для безопасности и юридических вопросов это, вероятно, к лучшему.
Источник:
Читайте также
Исследователи подключили GPT-6 Astra напрямую к роботу и поручили ему убрать незнакомую кухню
Демократия застала врасплох кремниевых магнатов, мечтавших преобразить мир с помощью ИИ
Nvidia выпустила бесплатную модель на 100 млн параметров, которая в реальном времени распознаёт до восьми собеседников
Десятки тысяч проверок безопасности показывают: инцидент OpenAI с Hugging Face был лишь началом
Ещё пятерых полицейских обвинили в злоупотреблении камерами Flock — скандалов уже не счесть
Билл Гейтс призвал регулировать ИИ: без контроля он может привести к миллиарду смертей
Goldman Sachs: к 2027 году Big Tech потратит на ИИ-инфраструктуру $1,2 трлн — намного больше прогнозов Уолл-стрит
«Люди встают и дают отпор»: жители Северного Девона восстают против огромного ИИ-дата-центра
Google тестирует покупки на принадлежащем Walmart маркетплейсе Flipkart через Gemini и режим ИИ в Индии
Чиновники: протесты против дата-центров в Австралии — заимствованный у США шум. «Мы не США»
Две трети ИТ-руководителей отмечают результаты от ИИ, но мало кто прервал бы из-за них отпуск гендиректора
Оператора дата-центра оштрафовали на $1 млн за выбросы токсичного газа в окрестностях
Исследование: доступ к ИИ почти полностью отбивает у людей желание отвечать «не знаю»
Глав OpenAI и Anthropic вызвали на сенатское расследование после инцидентов с вышедшими из-под контроля ИИ-агентами
Споры об ИИ уже влияют на выборы 2028 года: чего хотят кандидаты от демократов
Нарушенные обещания и отобранные земли: в крошечной индийской деревне строят ИИ-дата-центр гигантского масштаба
OpenAI пыталась скрыть, что ChatGPT подробно объяснял школьному стрелку, как добиться максимального числа жертв. Переписки ужасают.
Оксфорд разрешил OpenAI обучать ИИ-модели на материалах Бодлианской библиотеки
Muse от Meta — только для взрослых. Почему он похож на детскую игрушку?
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram