i
Новости
Новости · 2026-09-27

ИИ-агенты берут на себя всё больше работы над моделями, но решения по-прежнему принимают люди

@neuronium_ai @neuronium_ai

Исследователи, в том числе сотрудники китайского Фуданьского университета, изучили, как люди и ИИ-агенты вместе разрабатывали языковую модель Atria Dawn Preview. Команда проанализировала более 700 журналов задач от 56 участников и записи работы агентов. ИИ применяли в 96,5% рассмотренных задач, но люди принимали 85,5% решений о методах и параметрах и выбирали цели в 93,4% случаев. При этом примерно треть завершённых задач с помощью ИИ участники не смогли бы выполнить без него. Авторы предупреждают: по мере того как цепочки работы агентов удлиняются, людям становится труднее проверять каждый шаг.

Обложка: ИИ-агенты берут на себя всё больше работы над моделями, но решения по-прежнему принимают люди

Проект был посвящён модели Atria Dawn Preview, построенной на архитектуре смеси экспертов. В ней 744 миллиарда параметров; она предназначена для исследовательских и инженерных задач.

Модель обучали с помощью пайплайна, в котором каждая задача связана с реальной средой выполнения. Модель вызывает инструменты, создаёт промежуточные результаты, а затем проверяет их по внешним сигналам — тестам, метрикам или исходным данным. Команда утверждает, что модель лидирует в пяти из 16 бенчмарков, включая поиск в интернете и кибербезопасность, однако в целом не превосходит конкурентов.

Atria Dawn Preview лидирует в AutomationBench, CyberGym и MLE-Bench Lite, но уступает другим моделям в GDPval и SWE-Bench Pro

Atria Dawn Preview лидирует в AutomationBench, CyberGym и MLE-Bench Lite, но уступает другим моделям в GDPval и SWE-Bench Pro

Источник: the-decoder.com

Треть задач с ИИ не начали бы без него

ИИ использовали в 96,5% рассмотренных задач. По мере работы над проектом участники всё чаще передавали работу агентам: за четыре недели медианное соотношение действий агента к вводам человека выросло с 11 до 28,5.

Авторы предостерегают от вывода, будто агенты стали автономнее. После каждого решения человека агент выполнял больше шагов, но это не означало, что он сам принимал больше решений.

Участников также спрашивали, смогли бы они выполнить свою часть задачи без ИИ — в том же объёме и с тем же качеством. Из 455 завершённых задач с помощью ИИ 151 оценили как невыполнимую без него, то есть примерно треть. Эти задачи распределялись между 27 из 56 участников, а не были сосредоточены у нескольких особенно активных пользователей. В таких случаях ИИ не ускорял уже начатую работу, а позволял выполнить то, за что без него никто бы не взялся.

За четыре недели медианное число действий агента на один ввод человека выросло с 11 до 28,5

За четыре недели медианное число действий агента на один ввод человека выросло с 11 до 28,5

Источник: the-decoder.com

ИИ предлагает, человек выбирает

При выборе методов и параметров чаще всего использовали схему «ИИ предлагает, человек выбирает» — так происходило в 55,4% случаев. В целом люди принимали 85,5% решений о методах и параметрах, а ИИ — только 9,2%. Цели и рамки работы люди определяли в 93,4% случаев.

В зависимости от типа решения доля предложений ИИ составляла от 17 до 55%. Но доля окончательных решений оставалась у него однозначной. Предложения могли исходить от разных участников, однако окончательный выбор обычно делали люди. Даже в 151 задаче, признанной невыполнимой без ИИ, цель выбирал человек — в 95,4% случаев.

Участники сообщили, что около трети задач с помощью ИИ невозможно было бы выполнить без ИИ

Участники сообщили, что около трети задач с помощью ИИ невозможно было бы выполнить без ИИ

Источник: the-decoder.com

Люди дают контекст, а не выполняют работу вручную

Та же картина проявлялась, когда возникали трудности. Из 588 задач с зафиксированной сложностью 76% удалось продолжить благодаря вмешательству человека, а в 23% случаев агент справился сам. Обычно помощь заключалась в передаче информации: участники добавляли контекст или уточняли требования в 35,2% случаев, а в 34,7% — диагностировали проблему и меняли метод. Люди редко брались за работу сами: частичные правки составляли 3,2% случаев, а полный перехват задачи — только 0,7%.

Когда результат ИИ требовал исправлений, в 75,4% случаев агент вносил изменения самостоятельно после обратной связи от человека. Узким местом было человеческое суждение, а не выполнение работы.

Агенты часто предлагают методы, но окончательное решение в более чем 80 процентах случаев принимают люди

Агенты часто предлагают методы, но окончательное решение в более чем 80 процентах случаев принимают люди

Источник: the-decoder.com

Авторы описывают три этапа роли ИИ: сначала он был предметом исследований, затем стал инструментом для отдельных задач, а теперь выступает партнёром по проекту. В этой роли ИИ составляет планы и корректирует их в рамках целей, заданных людьми. Возможный четвёртый этап — рекурсивное самоулучшение, при котором более мощные модели создают ещё более мощных преемников.

Исследователи отмечают, что модель может лучше справляться с задачами, на которых её обучали, но не обязательно — с разработкой своей следующей версии. Открытым остаётся вопрос, как ИИ сможет предлагать разные направления исследований и оценивать их перспективность до получения результатов.

В трёх четвертях случаев с проблемами вмешательство человека продвигало работу вперёд — в основном за счёт предоставления контекста или диагностики, а не взятия задачи на себя

В трёх четвертях случаев с проблемами вмешательство человека продвигало работу вперёд — в основном за счёт предоставления контекста или диагностики, а не взятия задачи на себя

Источник: the-decoder.com

Команда Atria описывает эволюцию ИИ от объекта исследования до партнёра по проекту. Следующий этап — рекурсивное самосовершенствование — остаётся открытым вопросом

Команда Atria описывает эволюцию ИИ от объекта исследования до партнёра по проекту. Следующий этап — рекурсивное самосовершенствование — остаётся открытым вопросом

Источник: the-decoder.com

Риск формального контроля

Если каждое решение опирается на цепочку работы агента, которую человек уже не успевает проверить целиком, надзор становится сложным. В худшем случае люди превращаются в проверяющих, способных лишь формально одобрять увиденное, пишут авторы. Многие участники запускали агентов в автономном режиме, чтобы не прерывать длительные задачи постоянными запросами на подтверждение. Границу автономности они выбирали ради удобства, а не в результате обдуманного решения о том, сколько полномочий следует передать ИИ.

Исследование появилось на фоне споров о рекурсивном самоулучшении. Anthropic считает, что ИИ может создать собственного преемника раньше, чем ожидалось; генеральный директор компании Дарио Амодей в ответ призывает установить для отрасли ограничение скорости. По данным Anthropic, сейчас люди принимают лишь однозначный процент решений о направлении исследований в компании. OpenAI использует GPT-5.6 Sol на всём цикле разработки, а Google и DeepMind позволяют ИИ-агентам искать альтернативные стратегии с помощью записанных траекторий поиска Dream-RSI. При этом агенты улучшают только стратегию поиска, а не саму модель.

Более тысячи сотрудников ведущих ИИ-компаний недавно предупредили, что их организации могут быть близки к автоматизации исследований в области ИИ. Другое исследование, проведённое Принстонским университетом и Институтом безопасности ИИ Великобритании, пришло к выводу, более близкому к результатам команды Atria: передовые модели справляются с инженерными задачами в исследованиях, но не с важными решениями, требующими суждения.

«Я не могу быть такой мамой, какой хочу»: почему материнство кажется миллениалам невыполнимой задачей? OpenAI: 80–90% исследований уже нацелены на GPT-7 и последующие модели Работники тратят поразительно много собственных денег на ИИ для работы Некоторые ветераны Anthropic, по сообщениям, скупают удалённую землю на случай, если «ИИ выйдет из-под контроля» Учёные загрузили передовую ИИ-модель в беспилотную машину и выпустили её на трассу Исследователи подключили GPT-6 Astra напрямую к роботу и поручили ему убрать незнакомую кухню Демократия застала врасплох кремниевых магнатов, мечтавших преобразить мир с помощью ИИ Nvidia выпустила бесплатную модель на 100 млн параметров, которая в реальном времени распознаёт до восьми собеседников Десятки тысяч проверок безопасности показывают: инцидент OpenAI с Hugging Face был лишь началом Ещё пятерых полицейских обвинили в злоупотреблении камерами Flock — скандалов уже не счесть Билл Гейтс призвал регулировать ИИ: без контроля он может привести к миллиарду смертей Goldman Sachs: к 2027 году Big Tech потратит на ИИ-инфраструктуру $1,2 трлн — намного больше прогнозов Уолл-стрит «Люди встают и дают отпор»: жители Северного Девона восстают против огромного ИИ-дата-центра Google тестирует покупки на принадлежащем Walmart маркетплейсе Flipkart через Gemini и режим ИИ в Индии Чиновники: протесты против дата-центров в Австралии — заимствованный у США шум. «Мы не США» Две трети ИТ-руководителей отмечают результаты от ИИ, но мало кто прервал бы из-за них отпуск гендиректора Оператора дата-центра оштрафовали на $1 млн за выбросы токсичного газа в окрестностях Исследование: доступ к ИИ почти полностью отбивает у людей желание отвечать «не знаю» Я создала интерактивного цифрового аватара — и с ним можно поговорить Глав OpenAI и Anthropic вызвали на сенатское расследование после инцидентов с вышедшими из-под контроля ИИ-агентами

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram