i
ДАТАИСТ
Обзор · 2026-01-14

Когда данных нет совсем, а учиться всё равно нужно: как ИИ сам придумывает задачи и сам себя проверяет

Когда данных нет совсем, а учиться всё равно нужно: как ИИ сам придумывает задачи и сам себя проверяет

В последние пару лет обучение рассуждению LLM делают через Reinforcement Learning with Verifiable Rewards (RLVR): модель решает задачу, получает награду, которую можно строго проверить, и постепенно начинает рассуждать лучше - так не нужно размечать цепочки рассуждений, достаточно уметь проверять ответ.

Но у RLVR есть проблема. Модели учатся на наборах задач, которые кто-то заранее собрал: вопросы по математике, задачки по коду, пары «вопрос–ответ». То есть мы убрали разметку рассуждений, но не убрали человеческое распределение задач. А оно дорогое, ограниченное и, что важнее, может стать узким местом.

Авторы работы “Absolute Zero: Reinforced Self-play Reasoning with Zero Data” предлагают моделе быть не только исполнителем, но и планировщиком задач — причём без внешних данных вообще.

Иллюстрация идеи Absolute Zero: вместо обучения на человеческих задачах агент сам придумывает задания и учится на проверяемой обратной связи от среды.

Сам себе преподаватель: как устроен Absolute Zero

В центре подхода — цикл, напоминающий self-play из AlphaZero, только вместо игры здесь пространство задач. Одна и та же модель играет две роли. В роли proposer она придумывает задачу. В роли solver — решает её. Смысл в том, чтобы proposer не генерировал слишком простые или слишком сложные задания, а искал «зону ближайшего развития»: там, где solver иногда ошибается, а иногда справляется. Именно такие задачи дают максимальный обучающий эффект.

Важнейшая деталь — награда должна быть проверяемой, иначе система быстро научится «взламывать» оценщика. Поэтому авторы заземляют весь процесс в исполнении кода: среда — это Python, который может строго проверить корректность задачи и ответа.

Цикл Absolute Zero: модель предлагает задачу, среда валидирует её и даёт сигнал обучаемости, затем модель решает задачу и получает награду за правильность.

Absolute Zero Reasoner

Реализация называется Absolute Zero Reasoner (AZR). Она строит обучение вокруг триплета program–input–output и заставляет модель тренировать три разных «режима мышления».

Deduction — предсказать output, если известны program и input. Это похоже на симуляцию кода в голове.

Abduction — восстановить input, если даны program и output. Тут часто приходится действовать через подбор и проверки: подошло ли, даёт ли нужный результат.

Induction — восстановить program по нескольким парам input/output. Это уже похоже на синтез программы по примерам и проверку на скрытых тестах.

Именно сочетание трёх типов задач, как показывают абляции, заметно влияет на рост качества, особенно в математике.

Общая схема обучения AZR: генерация задач трёх типов, фильтрация через Python, решение, проверка и совместное обновление proposer и solver.

Что получилось

Самая интригующая часть работы — результаты. AZR обучается с нулём внешних данных: без датасетов задач, без человеческих примеров, без разметки цепочек рассуждений. И при этом на выходе показывает уровень SOTA по суммарным метрикам в коде и математике.

Ключевые числа из сводной таблицы: AZR-Coder-7B даёт CAvg=61.6 (+5.0), MAvg=39.1 (+15.2), общий AVG=50.4 (+10.2) относительно базовой модели. Причём в математике скачок особенно заметен. Авторы отдельно подчёркивают, что обычный RLVR на экспертных кодовых моделях в среднем прибавляет математике всего 0.65 пункта, а AZR — 10.9 и 15.2 для base и coder вариантов.

Ещё один важный вывод: кодовые priors усиливают рассуждение. Стартовая Qwen-Coder-7B была по математике на 3.6 пункта слабее Qwen-7B, но после тренировки AZR уже обгоняет её на 0.7. Похоже, умение «думать в терминах программ» становится универсальным инструментом.

Главный итог: AZR обучается без данных и при этом превосходит ряд моделей, натренированных на десятках тысяч человеческих in-domain примеров.

Масштабирование и «человеческие» привычки внутри кода

Авторы проверяют разные размеры моделей и видят устойчивый тренд: чем сильнее база, тем больше выигрыш. Для coder-моделей прирост общего среднего вне распределения составляет +5.7 (3B), +10.2 (7B), +13.2 (14B). Это хороший сигнал для масштабирования.

Интересное наблюдение по поведению: в индукции модель начинает естественно вставлять планы в комментариях, чередуя размышления и код — очень похоже на ReAct, только без явного принуждения.

Пример того, как модель сама начинает писать промежуточные планы в комментариях во время генерации кода.

А вот в абдукции ответы становятся длиннее сильнее всего: логика понятна — там больше проб и ошибок.

Пример абдукции: модель подбирает вход, проверяя его через выполнение программы, пока не совпадёт нужный выход.

Вопрос безопасности никуда не делся

Работа честно фиксирует и тревожный момент: при обучении AZR на Llama3.1-8B иногда появляются потенциально небезопасные фрагменты chain-of-thought. Это важное напоминание: даже если мы убираем человека из процесса разметки датасетов, мы не убираем необходимость safety-aware training и мониторинга. Скорее наоборот — саморазгоняющиеся учебные циклы требуют более внимательного контроля.

«Uh-oh moment»: пример неожиданной и потенциально небезопасной цепочки рассуждений, возникшей в процессе self-play обучения.

Что это меняет в обучении LLM

Absolute Zero — это попытка не просто обучать без разметки рассуждений, а вообще без человеческих задач. В этой логике главным ресурсом становится не датасет, а среда, которая умеет проверять ответы и валидировать сами задания. В статье это Python-исполнитель, но авторы явно намекают на расширение: веб-среды, формальные языки, модели мира, симуляторы и даже embodied AI.

Если смотреть шире, это ещё и смена акцента: модель учится не только решать, но и выбирать, чему учиться. И именно в этом месте идея выглядит особенно перспективной — и одновременно требующей большой аккуратности.

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день.

В Telegram