на пути к рекурсивному самоулучшению
Последний ИИ, которого собрали люди
Идея старая и пугающе простая: в какой-то момент ИИ перестанет просто решать задачи и начнёт улучшать сам себя. Не в смысле «переписал ответ получше», а в смысле «поменял собственный способ учиться, проверять себя, накапливать опыт и строить следующую версию». Именно этому посвящена большая статья с громким названием «Последний ИИ, которого собрали люди».
Но интересно здесь не название. Авторы пытаются навести порядок в хаосе разговоров про самосовершенствующийся ИИ. Где заканчиваются обычные агентные приёмы? Где начинается настоящая рекурсивная самоулучшаемость? И главное: что уже происходит в индустрии, а что пока остаётся красивой демкой.
Их главный тезис звучит так: сегодняшние LLM уже умеют многое, но развитие идёт очень неровно. В задачах с чёткой проверкой они прибавляют быстро. В длинных, многошаговых, «грязных» рабочих процессах — заметно хуже. И именно там самоулучшающиеся системы могут дать самый большой выигрыш.
Что такое рекурсивное самоулучшение
Если коротко, рекурсивное самоулучшение — это когда ИИ использует опыт и обратную связь, чтобы вносить устойчивые изменения в самого себя, а потом эти изменения помогают ему улучшаться дальше.
Ключевое слово здесь — устойчивые. Если модель в одном чате поправила собственную ошибку, это ещё не оно. Если агент после серии задач поменял свою обвязку, библиотеку навыков, правила выбора данных или даже способ проверки новых версий — вот это уже ближе.
Авторы предлагают смотреть не на отдельный алгоритм, а на цикл улучшения:
🟠 что система меняет
🟠 кто решает, как это менять
🟠 что сохраняется между итерациями
🟠 влияет ли обновление на следующий раунд улучшений
Это важная схема. Потому что сегодня легко спутать три разные вещи:
🟣 улучшение ответа в одной сессии
🟣 улучшение системы между задачами
🟣 улучшение самого механизма улучшения
Именно третья ступень больше всего интересует авторов.
Пять уровней автономности: от выполнения заданного улучшения до изменения самого механизма будущих улучшений.
Пять уровней: от «сделай по инструкции» до «улучши способ улучшать»
Авторы делят прогресс на пять уровней. Это самый полезный кусок всей работы.
Уровень 1: ИИ умеет выполнять заданную процедуру улучшения. Человек всё ещё решает, что исправлять, как именно и по каким критериям. ИИ только масштабно исполняет. Например, размечает данные, фильтрует корпус, прогоняет тесты, вносит типовые правки.
Уровень 2: ИИ уже сам выбирает стратегию улучшения. Цель и критерии остаются внешними, но система сама решает, куда копать дальше: какой промт переписать, какую часть обвязки агента поменять, какой эксперимент поставить.
Уровень 3: ИИ решает, какой опыт ему нужен дальше. Он не просто учится на данных, которые ему дали, а сам формирует следующую порцию практики: генерирует задачи, выбирает упражнения, строит учебную программу под собственные слабые места.
Уровень 4: ИИ адаптируется в реальной эксплуатации. Опыт из продакшена попадает в память, навыки, код или обвязку, а потом влияет на будущие задачи. Это уже не учебная песочница, а работа с живой средой.
Уровень 5: ИИ меняет сам механизм улучшения. То есть не только решает задачи лучше, но и переписывает исследовательскую политику, проверяющий модуль, процедуру отбора кандидатов или способ порождения следующего улучшения.
Как расширяется цикл самоулучшения: на каждом уровне ИИ берёт под контроль ещё одну часть процесса.
Если упростить до одной мысли, то прогресс выглядит так:
🟠 сначала ИИ делает улучшения по инструкции
🟠 потом сам выбирает, какие улучшения пробовать
🟠 потом сам выбирает, на чём учиться
🟠 потом учится на продакшене
🟠 потом переписывает саму машину улучшений
Почему это важно
Авторы начинают с проблемы: разрабатывать передовые модели становится слишком дорого и трудно.
Растут не только размеры моделей. Растёт всё вокруг:
🟣 объём вычислений
🟣 число экспериментов
🟣 затраты на данные
🟣 расходы на проверку
🟣 сложность инструментов
🟣 объём ручной инженерной работы
Даже если в пайплайне уже много автоматизации, люди всё ещё решают самые дорогие вопросы: что улучшать дальше, как проверять результат, какой опыт считать полезным, что можно перенести в следующую версию.
Авторы прямо говорят: узкое место уже не только в обучении модели. Узкое место — во всём цикле улучшения.
Отсюда и интерес к самоулучшающимся системам. Если ИИ сможет брать на себя всё большую часть этого цикла, то он будет не просто отвечать полезнее, а ускорять собственное развитие.
У LLM неровный прогресс
Одна из самых интересных частей работы — попытка честно измерить, где современные модели уже почти добрались до потолка, а где до него ещё очень далеко.
Авторы собирают результаты по разным областям и нормализуют их с помощью своей метрики, которую можно перевести как индекс закрытого зазора. Идея простая: не смотреть на сырые баллы из разных бенчмарков, а оценивать, какую долю от доступного «запаса до идеала» модели уже выбрали.
Картина получается неровная.
Траектории прогресса по разным областям: в интерактивных и инструментальных задачах запас для роста заметно больше.
К 2026 году модели особенно далеко продвинулись в задачах вроде продвинутой математики и научных экзаменов. А вот там, где нужны инструменты, длинные многошаговые действия, работа с состоянием среды и накоплением контекста, отставание заметно больше.
Короткая выжимка:
🟠 математика и научные тесты заметно ближе к потолку
🟠 задачи по программированию растут, но медленнее
🟠 поисковые и терминальные агенты отстают
🟠 агенты с инструментами остаются одними из самых слабых
Именно это подводит авторов к главной мысли статьи: рекурсивное самоулучшение нужнее всего там, где длинный цикл, много состояния и дорогая проверка. То есть в программировании, робототехнике, научных исследованиях, медицине, рабочих средах.
Что уже умеют реальные системы
В статье много конкретных примеров из академии и индустрии.
На уровне 1 уже много систем. Они умеют автоматически чистить данные, синтезировать обучающие примеры, оптимизировать код, развёртывать модели, запускать заранее определённые пайплайны проверки. Это уже рабочая автоматизация.
На уровне 2 начинается самое интересное. Здесь ИИ сам выбирает, какой промт, какой модуль агента или какую часть обучающего процесса менять. В задачах по программированию это особенно видно: агент анализирует следы выполнения, находит слабое место в своей обвязке и предлагает исправление, которое потом проходит тесты.
На уровне 3 появляются системы, которые сами подбирают себе следующий опыт. Например:
🟣 генерируют задачи около текущей границы способностей
🟣 устраивают себе самоигру
🟣 выбирают, какой навык тренировать следующим
🟣 строят учебную программу по собственным провалам
Это важно, потому что выбор следующего опыта часто ценнее, чем ещё один раунд дообучения на старых данных.
На уровне 4 речь уже о памяти, навыках и правилах, которые агент накапливает в ходе реальной работы. Он может сохранить удачную процедуру, новую утилиту, правило обхода ошибки, полезный фрагмент плана — и использовать его дальше. Здесь много работы идёт вокруг библиотек навыков, памяти и обновляемой обвязки.
На уровне 5 примеров пока мало, и почти все они ограничены. Самый близкий вариант — когда система меняет не только свою задачу, но и политику исследований или оценщик, который решает, что считать улучшением.
Переход от адаптации в среде к мета-улучшению: на верхнем уровне меняется уже сам процесс будущих улучшений.
Где труднее всего: проверка, переносимость, деградация
Авторы много раз возвращаются к одной и той же мысли: самоулучшение легко симулировать и трудно доказать.
Система может показывать лучшие цифры по трём причинам:
🟠 она правда стала лучше
🟠 она лучше подстроилась под конкретный оценщик
🟠 ей просто дали больше попыток, вычислений и поиска
Отсюда три больших риска.
Первый — небезопасное наследование. Если плохое обновление стало частью постоянного состояния системы, оно может портить следующие раунды.
Второй — ложная автономность. Иногда кажется, что ИИ улучшает себя сам, но на деле самые важные решения остаются жёстко зашиты снаружи.
Третий — ломающаяся проверка. Если система слишком часто взаимодействует с оценщиком, она может научиться обманывать именно его, а не становиться лучше по сути.
Для уровня 5 это особенно неприятно. Если вы меняете ещё и сам оценщик, становится трудно понять, что произошло на самом деле: агент вырос или просто сместилась линейка.
Почему программирование стало главной лабораторией
Из всех прикладных областей статья особенно выделяет программирование. Причина проста: там и продукт, и сам агент — это исполнимый код. Его можно менять, тестировать, откатывать, сравнивать версии.
Поэтому именно в задачах по программированию сегодня лучше всего видно, как может работать цикл самоулучшения:
🟣 агент решает задачу в репозитории
🟣 получает обратную связь через тесты и трассы
🟣 меняет свою обвязку, инструменты или стратегию
🟣 сохраняет изменение
🟣 использует новую версию на следующей задаче
Это не значит, что программирование уже решено. Наоборот: авторы показывают, что даже здесь полное рекурсивное самоулучшение ещё не доказано. Но здесь проще всего строить воспроизводимые циклы, измерять стоимость улучшений и ловить регрессии.
Что показывает индустрия
Отдельный плюс работы — большая карта индустриальных практик. Там много систем, которые по частям собирают будущий цикл самоулучшения.
Есть компании, которые строят дата-пайплайны, где агент сам структурирует, проверяет и исправляет данные на следующих итерациях. Есть системы, где ошибки из продакшена превращаются в новые правила для проверки качества. Есть подходы, где агент для программирования хранит не просто текстовую память, а целый банк опыта: код, логи, оценки, следы запуска.
Промышленный цикл Theseus: среда, данные и модель улучшаются вместе и подпитывают следующий раунд.
Один из повторяющихся мотивов во всех этих кейсах: самоулучшение почти никогда не полностью автономно. Люди всё ещё держат снаружи цели, ограничения безопасности, защищённую проверку и право финального принятия изменений.
И это самый честный вывод всей статьи Разговор о том, что всё больше частей цикла улучшения уже переходят под контроль самих систем.
Вывод
Если вы хотите понять, где сейчас проходит реальная граница прогресса в ИИ, смотреть надо не только на бенчмарки знаний и рассуждение. Смотреть нужно на то, умеет ли система накапливать опыт, менять себя между задачами и использовать эти изменения для следующего раунда улучшений.
Главные выводы можно собрать в короткий список:
🟠 рекурсивное самоулучшение — это не один алгоритм, а цикл
🟠 у современных LLM самый большой запас роста остаётся в длинных интерактивных задачах
🟠 самый заметный прогресс сегодня — на уровнях 1 и 2, частично на 3 и 4
🟠 уровень 5 пока существует в виде ограниченных прототипов и индустриальных заготовок
🟠 главная проблема теперь не только научить модель, а построить надёжный цикл улучшения вокруг неё
Из этого следует простая вещь: следующий большой скачок в ИИ может прийти не от ещё одного увеличения модели, а от того, что сама разработка моделей, агентов и их обвязки станет замкнутым, накопительным процессом. Когда каждая итерация оставляет после себя не только лучший ответ, но и лучшую машину для следующей итерации.
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram