i
ДАТАИСТ
Новости · 2026-08-29

Исследователь Anthropic только что дал нам представление о самоулучшающемся ИИ

Anthropic опубликовала исследование о системе, которая с помощью ИИ улучшает поведение другой модели на бенчмарках согласования. На 10 тестах для конкретных нежелательных форм поведения автоматизированная система повысила результаты во всех случаях и не ухудшила общую производительность. Под руководством исследователя из программы стипендиатов Anthropic Chen Yueh-Han система ищет научные работы, предлагает методы обучения и проверяет их, приближая ИИ к самостоятельному проведению исследований.

Обложка: Исследователь Anthropic только что дал нам представление о самоулучшающемся ИИ

Anthropic показала систему для самоулучшения согласования ИИ

Anthropic опубликовала исследование о системе, которая с помощью ИИ улучшает поведение другой модели на бенчмарках согласования. На 10 тестах для конкретных нежелательных форм поведения автоматизированная система повысила результаты во всех случаях и не ухудшила общую производительность. Под руководством исследователя из программы стипендиатов Anthropic Chen Yueh-Han система ищет научные работы, предлагает методы обучения и проверяет их, приближая ИИ к самостоятельному проведению исследований.

Что умеет система

В пятницу Anthropic выпустила работу «Автоматизированные исследователи могут надёжно снижать сбои согласования». В ней описан подход, при котором ИИ-системы улучшают показатели модели на заранее заданных бенчмарках согласования.

Получив 10 бенчмарков, посвящённых конкретным видам несогласованного поведения, автоматизированные системы улучшили результат на каждом из них. При этом общая производительность модели не снизилась.

Система воспроизводит многие этапы обычного исследования. Она изучает доступную научную литературу, предлагает метод и в течение 30 минут обучает модель с его помощью. Затем процесс повторяется несколько раз: бенчмарк постепенно усложняется, рабочие методы сохраняются, а неэффективные отбрасываются. Благодаря этому система может быстро проверять большое число вариантов.

10бенчмарков
30 минутобучение за один цикл
несколько итерацийпостепенное усложнение бенчмарка

В работе говорится, что результаты дают первые основания считать автоматизированное дообучение для согласования практически применимым в ближайшей перспективе.

Шаг к самоулучшению

Исследование приближает ИИ к рекурсивному самоулучшению — сценарию, который многие считают следующим заметным этапом развития технологий. Если модели научатся самостоятельно улучшать обучение согласованию, они, вероятно, смогут совершенствовать и другие методы подготовки. В таком случае роль исследователей, занимающихся ИИ, может постепенно сократиться.

Авторы прямо сравнивают свою систему «Автоматизированный исследователь согласования», или AAR, с человеком. Согласно работе, лучший метод AAR в среднем превосходит предложения опытных исследователей уже через шесть часов. Направления исследований, выбранные людьми, не приводят к более высокой производительности.

Есть и сравнение стоимости: инференс AAR через API обходится примерно в $4 в час, тогда как на работу исследователей Anthropic тратит $150 в час.

AARпримерно $4 в час
Исследователи Anthropic$150 в час

Ограничения подхода

Автоматизированная система работает только в той мере, в какой бенчмарки действительно отражают цели согласования. Даже при этом остаётся много работы: нужно создавать и поддерживать сами бенчмарки, а также обновлять и расширять научную литературу, на которую опираются автоматизированные исследователи.

Источник: techcrunch.com

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram