Самоулучшение будет медленным
Через несколько дней после ухода из Google DeepMind Ориол Виньялс выступил на Agentic ИИ Summit 2026 и рассказал о рекурсивном самоулучшении ИИ — одной из обсуждаемых тем в исследованиях ИИ. Виньялс был вице-президентом по исследованиям в DeepMind и участвовал в создании AlphaStar, AlphaCode и Gemini.
Он считает неизбежным постепенное самоулучшение систем, но не ожидает внезапного ускорения их интеллектуального развития. Измерять прогресс в самоулучшении трудно, а реализовать его на практике ещё сложнее. По оценке Виньялса, ИИ сможет ускорить отдельные исследовательские и инженерные задачи в десять и более раз, но самоподдерживающийся взрыв интеллекта маловероятен.
Что именно должно улучшаться
Сначала нужно определить, какую часть системы предполагается менять. У ИИ много компонентов, и улучшения могут затрагивать каждый из них:
Для каждого направления возникают свои технические и регуляторные сложности.
По словам Виньялса, системе, которая пытается улучшить себя, нужны перспективная идея, код для её реализации, эксперименты для проверки и надёжный способ понять, принесло ли изменение пользу. С двумя средними этапами ИИ уже справляется лучше: он пишет код и проводит эксперименты. Основные проблемы остаются на этапах генерации идей и оценки результата.
Два главных узких места
Сегодня лаборатории в основном измеряют самоулучшение косвенно — через бенчмарки способностей вроде SWE-Bench Pro и ML-Bench. Системы поднимаются в таблицах лидеров, а исследователи надеются, что самоулучшение возникнет как побочный эффект. Такие тесты недороги и хорошо определены, но преимущественно проверяют реализацию и эксперименты — именно те этапы, которые уже работают.
Дополнительные проблемы создают переобучение и поиск обходных путей. За годы работы над игровыми агентами Виньялс наблюдал, как системы используют цели неожиданным образом: они побеждают систему подсчёта очков, вместо того чтобы действительно играть по правилам игры.
Более содержательные бенчмарки должны проверять самоулучшение напрямую. Первые такие тесты уже появляются: системе задают метрику и бюджет вычислений, а затем измеряют, насколько она смогла улучшить себя. Этот подход дорогой, потому что для каждой оценки агент должен часами выполнять задачи, далёкие от конечной цели. Например, агент может оптимизировать игру «Тетрис», тогда как настоящая задача заключается в автоматизации целой исследовательской лаборатории и создании лучшей в мире модели.
Генерация идей развита не лучше. Для хорошего исследования нужен инстинкт, позволяющий понять, какие идеи вообще стоит развивать. Виньялс называет это «исследовательским вкусом». В обучении больших языковых моделей пока почти не изучали, как сформировать такую способность.
В будущем оценки, по мнению Виньялса, должны учитывать не только достигнутый результат, но и путь к нему. Для идей это означает проверку по критериям, которыми пользуются рецензенты научных конференций:
Некоторые из этих критериев можно описать правилами и проверять с помощью моделей вознаграждения, а затем использовать для обучения с подкреплением. Однако сделать это трудно, и на такую работу потребуется больше времени. Проверка людьми тоже обходится дорого и не всегда позволяет заметить сильные идеи.
Есть и физические ограничения. Чипы не могут вычислять быстрее, чем позволяют их конструкция и скорость света. Поэтому даже алгоритм, разработанный ИИ, всё равно ограничен оборудованием, на котором запускается. В некоторых областях возможности человека уже могут быть близки к верхнему пределу. Виньялс приводит пример AlphaGo: неизвестно, насколько хорошо эта система играет по сравнению с идеальной партией в го.
Discovery Loop автоматизирует научный цикл
Виньялс решил проверить свои выводы на практике и создаёт стартап Discovery Loop. Вместе с ним компанию основывают Джефф Дин, который станет генеральным директором, старший научный сотрудник Google Санджай Гхемават и сооснователь Google Brain Куок Ле.
Компания хочет автоматизировать полный научный цикл:
В проект входят и два этапа, на которых ИИ пока особенно слаб: создание идей и проверка их ценности. Трое из четырёх основателей входят в число наиболее цитируемых исследователей ИИ, а Гхемават также относится к наиболее цитируемым специалистам по распределённым системам.
Сначала команда займётся исследованиями ИИ. Сам Discovery Loop станет первым заказчиком собственных инструментов — так это сформулировал Джефф Дин. Позже стартап планирует перейти к другим научным областям.
На сайте компании основатели описывают будущее, в котором небольшая группа людей сможет проводить научные и инженерные исследования быстрее и качественнее, чем сегодня это делают крупные коллективы учёных и инженеров. Виньялс признаёт, что создание идей остаётся самой сложной частью процесса, поэтому на раннем этапе люди и машины будут разрабатывать гипотезы совместно.
Источник: the-decoder.com
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram