i
ДАТАИСТ
Новости · 2026-09-13

GPT-6 Astra пилотирует дрон наблюдения и сама ведёт бизнес

@neuronium_ai @neuronium_ai

Andon Labs проверила GPT-6 Astra в двух бенчмарках для ИИ-агентов — Vending-Bench и Drone-Bench. В симуляции бизнеса с торговыми автоматами модель OpenAI за шесть запусков получила средний итоговый баланс $15 515 против $5 422 у Claude Fable 5.1. В Drone-Bench Astra стала первой моделью, чьи лучшие попытки превзошли эталон человека и ИИ во всех пяти задачах, включая написание кода для автономного поиска и сопровождения конкретного человека дроном. При этом стабильность результатов пока остаётся низкой.

Обложка: GPT-6 Astra пилотирует дрон наблюдения и сама ведёт бизнес

Andon Labs использует Vending-Bench и Drone-Bench, чтобы оценивать, насколько хорошо модели действуют самостоятельно в течение длительного времени и пишут программы для физических систем. В первом бенчмарке они управляют бизнесом, во втором — программируют недорогой дрон DJI Tello EDU.

Astra зарабатывает больше

В Vending-Bench каждой модели выдают $500 и предлагают управлять торговым автоматом на протяжении смоделированного года. Модель ищет поставщиков, договаривается о закупочных ценах, заказывает товары, устанавливает розничные цены и пытается увеличить баланс.

За шесть запусков GPT-6 Astra получила средний итоговый баланс $15 515, сообщает Andon Labs. У Claude Fable 5.1 средний результат составил $5 422. Даже лучший запуск Fable — $9 874 — оказался ниже худшего результата Astra: $13 272. Astra стала первой моделью OpenAI, возглавившей таблицу Vending-Bench 2. Разрыв со второй моделью оказался крупнейшим за всю историю этого бенчмарка.

$15 515средний баланс Astra
$5 422средний баланс Fable
Итоговые остатки на банковских счетах по итогам шести прогонов Vending-Bench 2 для каждой модели. Столбцы показывают средние значения; точки — отдельные прогоны. Каждый прогон Astra превосходит каждый прогон Fable

Итоговые остатки на банковских счетах по итогам шести прогонов Vending-Bench 2 для каждой модели. Столбцы показывают средние значения; точки — отдельные прогоны. Каждый прогон Astra превосходит каждый прогон Fable

Источник: the-decoder.com

Одно из главных различий проявилось при закупках. Со временем Fable соглашалась на всё менее выгодные условия. Средняя цена обычной банки Coca-Cola выросла для неё с $1,17 в первые 90 дней до $2,21 к концу смоделированного года. Astra торговалась стабильнее. В одном из описанных Andon Labs случаев поставщик запросил за набор товаров $226,32. Astra настояла на цене $108 и заключила сделку.

Astra также лучше справлялась с ненадёжными поставщиками. За шесть запусков Fable 5.1 45 раз перечисляла предоплату поставщикам, которые к тому моменту уже прекратили работу, и потеряла $14 331. Astra столкнулась с ещё большим числом закрытий — 64, — но Andon Labs не обнаружила у неё потерь из-за таких предоплат. Fable распознала проблему и написала правило: платить только после письменного подтверждения. Через несколько дней модель сама нарушила это правило.

Astra не соглашается на сговор

Andon Labs также проверяет модели в Vending-Bench Arena. В этом режиме несколько ИИ-агентов управляют конкурирующими торговыми автоматами в одном месте.

Astra прямо отказалась от предложения китайской модели GLM-5.3 зафиксировать цены. За три изученные игры арены Andon Labs не обнаружила у Astra ни одного случая лжи.

Claude Fable 5.1 участвовала в том, что Andon Labs классифицировала как незаконный сговор о ценах с GLM-5.3. Fable соблюдала договорённость только тогда, когда это отвечало её собственным интересам. Astra выиграла все три игры.

Andon Labs оценивает Astra как более эффективную в экономическом плане и лучше соответствующую заданным нормам поведения. При этом вывод основан на действиях моделей в бенчмарке и автоматически не переносится на другие ситуации.

Astra проходит пять задач Drone-Bench

Drone-Bench проверяет другую способность ИИ-агента. Модели пишут код, который позволяет недорогому дрону DJI Tello EDU самостоятельно перемещаться по офису, находить конкретного человека и следовать за ним. Бенчмарк состоит из пяти этапов:

13D-реконструкция окружающей среды.
2Определение местоположения дрона.
3Навигация.
4Обнаружение нужного человека.
5Слежение за ним.

Каждую задачу отдельно сравнивают с кодом, который разработчик-человек создал с помощью агентов для программирования для собственной демки Andon Labs. Для каждой задачи модель получает десять запусков и может отправить до десяти версий кода за один запуск. После каждой попытки она получает оценку и может улучшить решение.

3D-реконструкция GPT-6 Astra офисной среды

3D-реконструкция GPT-6 Astra офисной среды

Источник: the-decoder.com

В исходной статье, опубликованной в июле, самой сильной моделью была Claude Fable 5. Передовые модели хотя бы в одном запуске превосходили эталон человека и ИИ в четырёх из пяти задач. Нерешённой оставалась 3D-реконструкция. Andon Labs сообщает, что Astra стала первой моделью, чьи лучшие отправленные решения превзошли эталон во всех пяти задачах Drone-Bench, включая реконструкцию.

Astra собрала дата-пайплайн на основе COLMAP и DA3, добавив фильтрацию глубины. Модель использовала видеозаписи офиса, чтобы создать пригодную для навигации 3D-модель. По данным Andon Labs, она получила более высокий балл, чем эталонное решение человека и ИИ.

Лучшие результаты не гарантируют стабильность

В задаче на обнаружение человека Astra превзошла эталон в четырёх из десяти запусков. В 3D-реконструкции это произошло только в одном из десяти. Andon Labs подсчитала, что вероятность успешного прохождения всех пяти этапов подряд для среднего запуска Astra составляет лишь 2,8%.

Впервые универсальная передовая модель смогла создать код, превзошедший эталон на каждом участке задания. Но если перемножить вероятности успешного прохождения всех этапов, шанс полного запуска остаётся низким. Анализ прогресса за последние два года позволяет команде предположить, что передовая модель сможет решить все пять задач за одну попытку в первом квартале 2027 года.

GPT-6 Astra уже управляет дроном

В демке Andon Labs GPT-6 Astra самостоятельно проводит дрон через офис после промта ChatGPT, find this person and follow them. Модель находит конкретного человека и следует за ним. Пространственное картирование, навигация и слежение работают без участия человека. Другие бенчмарки также показывают особенно сильные способности GPT-6 Astra к пространственному рассуждению.

Подвергшим эксперимент критикам, которые спросили, зачем Andon Labs создаёт технологию, о которой постоянно предупреждают, лаборатория ответила: бенчмарк не учит ИИ управлять дроном, а измеряет, насколько хорошо современные модели уже умеют это делать. Шесть месяцев назад передовые модели не справлялись с этими задачами и разбивали дроны. Теперь Astra превосходит эталон человека на каждом этапе.

Andon Labs считает, что общество и законодатели должны узнать об этих способностях до того, как дроны с ИИ достигнут сверхчеловеческого уровня навигации. Доступа к бенчмарку нет ни у одной лаборатории. Andon Labs проводит все проверки самостоятельно, чтобы компании не могли оптимизировать модели специально под этот тест.

Источник: the-decoder.com

Сэм Альтман теперь пытается взять под контроль энергосети «Очень полезно»: ИИ-буткемпы для решения проблемы безработицы среди молодёжи Британии ИИ-агенты жаждут энергии Двухлетнее исследование: запрет ИИ в вузах ухудшает результаты студентов Альтман, Маск и Хассабис поддержали призыв Амодеи ввести независимый надзор Сэм Альтман: OpenAI не проведёт IPO в 2026 году из-за рисков для безопасности ИИ Австралия приближается к будущему, созданному ИИ: закон о правах человека нужен как никогда Законы штатов о чатах ИИ о психическом здоровье ведут к тревожному юрисдикционному дрейфу моделей Что происходит, когда ваши ИИ-сотрудники выходят из-под контроля? OpenAI нацеливает ChatGPT for Financial Services на задачи младших банковских аналитиков Как соцсети выявляют и маркируют контент, созданный ИИ Открытые веса — не открытый исходный код: теперь это важно для советов директоров Итан Моллик — о роях ИИ-агентов и провале Hugging Face Лангерианскую осознанность исследуют с помощью ИИ-персон в задании Triangle Task Предупреждение Коксона об ИИ стало мейнстримом. Что теперь? GPT-6 Astra, похоже, демонстрирует скачок в пространственном рассуждении — ранние тесты Стареющий Конгресс совершенно не готов регулировать ИИ — похоже, даже понять его не может OpenAI: GPT-6 Astra нужны более короткие промты и меньше ограничений Шаги рассуждений ИИ-моделей соответствуют разным внутренним паттернам — исследование Глава Anthropic Амодеи хочет ограничить скорость ИИ, пока самоулучшение не опередило контроль людей

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram