Anthropic показала систему для самоулучшения согласования ИИ
Anthropic опубликовала исследование о системе, которая с помощью ИИ улучшает поведение другой модели на бенчмарках согласования. На 10 тестах для конкретных нежелательных форм поведения автоматизированная система повысила результаты во всех случаях и не ухудшила общую производительность. Под руководством исследователя из программы стипендиатов Anthropic Chen Yueh-Han система ищет научные работы, предлагает методы обучения и проверяет их, приближая ИИ к самостоятельному проведению исследований.
Что умеет система
В пятницу Anthropic выпустила работу «Автоматизированные исследователи могут надёжно снижать сбои согласования». В ней описан подход, при котором ИИ-системы улучшают показатели модели на заранее заданных бенчмарках согласования.
Получив 10 бенчмарков, посвящённых конкретным видам несогласованного поведения, автоматизированные системы улучшили результат на каждом из них. При этом общая производительность модели не снизилась.
Система воспроизводит многие этапы обычного исследования. Она изучает доступную научную литературу, предлагает метод и в течение 30 минут обучает модель с его помощью. Затем процесс повторяется несколько раз: бенчмарк постепенно усложняется, рабочие методы сохраняются, а неэффективные отбрасываются. Благодаря этому система может быстро проверять большое число вариантов.
В работе говорится, что результаты дают первые основания считать автоматизированное дообучение для согласования практически применимым в ближайшей перспективе.
Шаг к самоулучшению
Исследование приближает ИИ к рекурсивному самоулучшению — сценарию, который многие считают следующим заметным этапом развития технологий. Если модели научатся самостоятельно улучшать обучение согласованию, они, вероятно, смогут совершенствовать и другие методы подготовки. В таком случае роль исследователей, занимающихся ИИ, может постепенно сократиться.
Авторы прямо сравнивают свою систему «Автоматизированный исследователь согласования», или AAR, с человеком. Согласно работе, лучший метод AAR в среднем превосходит предложения опытных исследователей уже через шесть часов. Направления исследований, выбранные людьми, не приводят к более высокой производительности.
Есть и сравнение стоимости: инференс AAR через API обходится примерно в $4 в час, тогда как на работу исследователей Anthropic тратит $150 в час.
Ограничения подхода
Автоматизированная система работает только в той мере, в какой бенчмарки действительно отражают цели согласования. Даже при этом остаётся много работы: нужно создавать и поддерживать сами бенчмарки, а также обновлять и расширять научную литературу, на которую опираются автоматизированные исследователи.

Источник: techcrunch.com
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram