i
ДАТАИСТ
Обзор · 2026-09-12

Последний ИИ, созданный людьми

Обложка: Последний ИИ, созданный людьми

на пути к рекурсивному самоулучшению

Последний ИИ, которого собрали люди

Идея старая и пугающе простая: в какой-то момент ИИ перестанет просто решать задачи и начнёт улучшать сам себя. Не в смысле «переписал ответ получше», а в смысле «поменял собственный способ учиться, проверять себя, накапливать опыт и строить следующую версию». Именно этому посвящена большая статья с громким названием «Последний ИИ, которого собрали люди».

Но интересно здесь не название. Авторы пытаются навести порядок в хаосе разговоров про самосовершенствующийся ИИ. Где заканчиваются обычные агентные приёмы? Где начинается настоящая рекурсивная самоулучшаемость? И главное: что уже происходит в индустрии, а что пока остаётся красивой демкой.

Их главный тезис звучит так: сегодняшние LLM уже умеют многое, но развитие идёт очень неровно. В задачах с чёткой проверкой они прибавляют быстро. В длинных, многошаговых, «грязных» рабочих процессах — заметно хуже. И именно там самоулучшающиеся системы могут дать самый большой выигрыш.

Что такое рекурсивное самоулучшение

Если коротко, рекурсивное самоулучшение — это когда ИИ использует опыт и обратную связь, чтобы вносить устойчивые изменения в самого себя, а потом эти изменения помогают ему улучшаться дальше.

Ключевое слово здесь — устойчивые. Если модель в одном чате поправила собственную ошибку, это ещё не оно. Если агент после серии задач поменял свою обвязку, библиотеку навыков, правила выбора данных или даже способ проверки новых версий — вот это уже ближе.

Авторы предлагают смотреть не на отдельный алгоритм, а на цикл улучшения:

🟠 что система меняет

🟠 кто решает, как это менять

🟠 что сохраняется между итерациями

🟠 влияет ли обновление на следующий раунд улучшений

Это важная схема. Потому что сегодня легко спутать три разные вещи:

🟣 улучшение ответа в одной сессии

🟣 улучшение системы между задачами

🟣 улучшение самого механизма улучшения

Именно третья ступень больше всего интересует авторов.

Пять уровней автономности: от выполнения заданного улучшения до изменения самого механизма будущих улучшений.

Пять уровней: от «сделай по инструкции» до «улучши способ улучшать»

Авторы делят прогресс на пять уровней. Это самый полезный кусок всей работы.

Уровень 1: ИИ умеет выполнять заданную процедуру улучшения. Человек всё ещё решает, что исправлять, как именно и по каким критериям. ИИ только масштабно исполняет. Например, размечает данные, фильтрует корпус, прогоняет тесты, вносит типовые правки.

Уровень 2: ИИ уже сам выбирает стратегию улучшения. Цель и критерии остаются внешними, но система сама решает, куда копать дальше: какой промт переписать, какую часть обвязки агента поменять, какой эксперимент поставить.

Уровень 3: ИИ решает, какой опыт ему нужен дальше. Он не просто учится на данных, которые ему дали, а сам формирует следующую порцию практики: генерирует задачи, выбирает упражнения, строит учебную программу под собственные слабые места.

Уровень 4: ИИ адаптируется в реальной эксплуатации. Опыт из продакшена попадает в память, навыки, код или обвязку, а потом влияет на будущие задачи. Это уже не учебная песочница, а работа с живой средой.

Уровень 5: ИИ меняет сам механизм улучшения. То есть не только решает задачи лучше, но и переписывает исследовательскую политику, проверяющий модуль, процедуру отбора кандидатов или способ порождения следующего улучшения.

Как расширяется цикл самоулучшения: на каждом уровне ИИ берёт под контроль ещё одну часть процесса.

Если упростить до одной мысли, то прогресс выглядит так:

🟠 сначала ИИ делает улучшения по инструкции

🟠 потом сам выбирает, какие улучшения пробовать

🟠 потом сам выбирает, на чём учиться

🟠 потом учится на продакшене

🟠 потом переписывает саму машину улучшений

Почему это важно

Авторы начинают с проблемы: разрабатывать передовые модели становится слишком дорого и трудно.

Растут не только размеры моделей. Растёт всё вокруг:

🟣 объём вычислений

🟣 число экспериментов

🟣 затраты на данные

🟣 расходы на проверку

🟣 сложность инструментов

🟣 объём ручной инженерной работы

Даже если в пайплайне уже много автоматизации, люди всё ещё решают самые дорогие вопросы: что улучшать дальше, как проверять результат, какой опыт считать полезным, что можно перенести в следующую версию.

Авторы прямо говорят: узкое место уже не только в обучении модели. Узкое место — во всём цикле улучшения.

Отсюда и интерес к самоулучшающимся системам. Если ИИ сможет брать на себя всё большую часть этого цикла, то он будет не просто отвечать полезнее, а ускорять собственное развитие.

У LLM неровный прогресс

Одна из самых интересных частей работы — попытка честно измерить, где современные модели уже почти добрались до потолка, а где до него ещё очень далеко.

Авторы собирают результаты по разным областям и нормализуют их с помощью своей метрики, которую можно перевести как индекс закрытого зазора. Идея простая: не смотреть на сырые баллы из разных бенчмарков, а оценивать, какую долю от доступного «запаса до идеала» модели уже выбрали.

Картина получается неровная.

Траектории прогресса по разным областям: в интерактивных и инструментальных задачах запас для роста заметно больше.

К 2026 году модели особенно далеко продвинулись в задачах вроде продвинутой математики и научных экзаменов. А вот там, где нужны инструменты, длинные многошаговые действия, работа с состоянием среды и накоплением контекста, отставание заметно больше.

Короткая выжимка:

🟠 математика и научные тесты заметно ближе к потолку

🟠 задачи по программированию растут, но медленнее

🟠 поисковые и терминальные агенты отстают

🟠 агенты с инструментами остаются одними из самых слабых

Именно это подводит авторов к главной мысли статьи: рекурсивное самоулучшение нужнее всего там, где длинный цикл, много состояния и дорогая проверка. То есть в программировании, робототехнике, научных исследованиях, медицине, рабочих средах.

Что уже умеют реальные системы

В статье много конкретных примеров из академии и индустрии.

На уровне 1 уже много систем. Они умеют автоматически чистить данные, синтезировать обучающие примеры, оптимизировать код, развёртывать модели, запускать заранее определённые пайплайны проверки. Это уже рабочая автоматизация.

На уровне 2 начинается самое интересное. Здесь ИИ сам выбирает, какой промт, какой модуль агента или какую часть обучающего процесса менять. В задачах по программированию это особенно видно: агент анализирует следы выполнения, находит слабое место в своей обвязке и предлагает исправление, которое потом проходит тесты.

На уровне 3 появляются системы, которые сами подбирают себе следующий опыт. Например:

🟣 генерируют задачи около текущей границы способностей

🟣 устраивают себе самоигру

🟣 выбирают, какой навык тренировать следующим

🟣 строят учебную программу по собственным провалам

Это важно, потому что выбор следующего опыта часто ценнее, чем ещё один раунд дообучения на старых данных.

На уровне 4 речь уже о памяти, навыках и правилах, которые агент накапливает в ходе реальной работы. Он может сохранить удачную процедуру, новую утилиту, правило обхода ошибки, полезный фрагмент плана — и использовать его дальше. Здесь много работы идёт вокруг библиотек навыков, памяти и обновляемой обвязки.

На уровне 5 примеров пока мало, и почти все они ограничены. Самый близкий вариант — когда система меняет не только свою задачу, но и политику исследований или оценщик, который решает, что считать улучшением.

Переход от адаптации в среде к мета-улучшению: на верхнем уровне меняется уже сам процесс будущих улучшений.

Где труднее всего: проверка, переносимость, деградация

Авторы много раз возвращаются к одной и той же мысли: самоулучшение легко симулировать и трудно доказать.

Система может показывать лучшие цифры по трём причинам:

🟠 она правда стала лучше

🟠 она лучше подстроилась под конкретный оценщик

🟠 ей просто дали больше попыток, вычислений и поиска

Отсюда три больших риска.

Первый — небезопасное наследование. Если плохое обновление стало частью постоянного состояния системы, оно может портить следующие раунды.

Второй — ложная автономность. Иногда кажется, что ИИ улучшает себя сам, но на деле самые важные решения остаются жёстко зашиты снаружи.

Третий — ломающаяся проверка. Если система слишком часто взаимодействует с оценщиком, она может научиться обманывать именно его, а не становиться лучше по сути.

Для уровня 5 это особенно неприятно. Если вы меняете ещё и сам оценщик, становится трудно понять, что произошло на самом деле: агент вырос или просто сместилась линейка.

Почему программирование стало главной лабораторией

Из всех прикладных областей статья особенно выделяет программирование. Причина проста: там и продукт, и сам агент — это исполнимый код. Его можно менять, тестировать, откатывать, сравнивать версии.

Поэтому именно в задачах по программированию сегодня лучше всего видно, как может работать цикл самоулучшения:

🟣 агент решает задачу в репозитории

🟣 получает обратную связь через тесты и трассы

🟣 меняет свою обвязку, инструменты или стратегию

🟣 сохраняет изменение

🟣 использует новую версию на следующей задаче

Это не значит, что программирование уже решено. Наоборот: авторы показывают, что даже здесь полное рекурсивное самоулучшение ещё не доказано. Но здесь проще всего строить воспроизводимые циклы, измерять стоимость улучшений и ловить регрессии.

Что показывает индустрия

Отдельный плюс работы — большая карта индустриальных практик. Там много систем, которые по частям собирают будущий цикл самоулучшения.

Есть компании, которые строят дата-пайплайны, где агент сам структурирует, проверяет и исправляет данные на следующих итерациях. Есть системы, где ошибки из продакшена превращаются в новые правила для проверки качества. Есть подходы, где агент для программирования хранит не просто текстовую память, а целый банк опыта: код, логи, оценки, следы запуска.

Промышленный цикл Theseus: среда, данные и модель улучшаются вместе и подпитывают следующий раунд.

Один из повторяющихся мотивов во всех этих кейсах: самоулучшение почти никогда не полностью автономно. Люди всё ещё держат снаружи цели, ограничения безопасности, защищённую проверку и право финального принятия изменений.

И это самый честный вывод всей статьи Разговор о том, что всё больше частей цикла улучшения уже переходят под контроль самих систем.

Вывод

Если вы хотите понять, где сейчас проходит реальная граница прогресса в ИИ, смотреть надо не только на бенчмарки знаний и рассуждение. Смотреть нужно на то, умеет ли система накапливать опыт, менять себя между задачами и использовать эти изменения для следующего раунда улучшений.

Главные выводы можно собрать в короткий список:

🟠 рекурсивное самоулучшение — это не один алгоритм, а цикл

🟠 у современных LLM самый большой запас роста остаётся в длинных интерактивных задачах

🟠 самый заметный прогресс сегодня — на уровнях 1 и 2, частично на 3 и 4

🟠 уровень 5 пока существует в виде ограниченных прототипов и индустриальных заготовок

🟠 главная проблема теперь не только научить модель, а построить надёжный цикл улучшения вокруг неё

Из этого следует простая вещь: следующий большой скачок в ИИ может прийти не от ещё одного увеличения модели, а от того, что сама разработка моделей, агентов и их обвязки станет замкнутым, накопительным процессом. Когда каждая итерация оставляет после себя не только лучший ответ, но и лучшую машину для следующей итерации.

ИИ-обзоры простыми словами

Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram