Когда у задачи нет правильного ответа
У больших языковых моделей есть старая проблема. Они хорошо учатся там, где можно точно проверить ответ: в математике, в задачах по программированию, в формальных головоломках. Ответ либо верный, либо нет. Машина получает понятный сигнал и улучшается.
Но как только задача становится открытой — написать рассказ, сделать хорошее резюме документа, подготовить связное объяснение, — всё усложняется. Кто решает, что текст «хороший»? Человек? Другая модель? Набор критериев? Во всех случаях появляется шум, смещение и дополнительные расходы на инференс.
Авторы предлагают неожиданный ход: не пытаться напрямую измерять качество открытого ответа, а переделать саму задачу так, чтобы внутри неё появился проверяемый сигнал. Из этой идеи вырос новый подход — RLSVR, то есть обучение с подкреплением с самопроверяемыми наградами, и его конкретная реализация SpyRL. По сути, модель учат через игру в «кто здесь шпион?».
Результаты показывают, что это способ перенести обучение с проверяемыми наградами в открытые задачи.
Что такое RLSVR
Обычный режим обучения с проверяемыми наградами работает просто: модель решает задачу, проверяющий модуль сравнивает результат с правильным ответом, дальше модель получает награду. Это удобно, дёшево и масштабируется. Но только там, где «правильный ответ» вообще существует.
RLSVR предлагает другой путь. Если у задачи нет встроенного проверяющего механизма, его можно сконструировать через преобразование задачи. Идея пришла из самосупервизии: там тоже нет разметки, но исследователи придумывают прокси-задачу, где метки рождаются автоматически из самих данных.
Здесь происходит примерно то же самое, только вместо меток появляются награды.
Схема такая:
🟠 Берётся исходная открытая задача — например, суммаризация длинного текста.
🟠 Среда заранее скрывает часть информации и запоминает, что именно было скрыто.
🟠 Модели выполняют ту же задачу, но в немного разных условиях.
🟠 Потом возникает дополнительный вопрос, на который можно ответить точно: кто работал с неполной информацией?
🟠 Этот ответ проверяется по записи среды, а значит награда получается без человека и без внешнего судьи.
Ключевой момент: прокси-задача должна быть связана с реальным качеством. Если плохой текст не помогает обнаружить скрытую нехватку информации, вся схема разваливается. Поэтому авторы показывают, как именно сделать такую связь плотной.
SpyRL: игра в шпиона
Конкретная реализация называется SpyRL. Здесь несколько копий модели играют в социальную игру.
Одному участнику назначают роль шпиона. Остальные — «мирные». Мирные получают полный вход. Шпион — испорченную версию: часть текста скрыта, контекст урезан или замаскирован. После этого все делают одну и ту же целевую задачу: пишут резюме, рассказ или математическое решение.
Потом начинается второй этап: все смотрят на ответы друг друга и голосуют, кто из них шпион.
И вот здесь появляется проверяемая награда.
Личность шпиона известна среде заранее. Значит, можно точно посчитать:
🟣 Кто правильно вычислил шпиона
🟣 Кто получил больше подозрений
🟣 Насколько хорошо шпион «смешался с толпой»
🟣 Насколько убедительно мирные участники отличили плохой ответ от хорошего
Для этапа распознавания награда совсем жёсткая: угадал шпиона — получил плюс, нет — ноль. Для этапа генерации награда зависит от числа голосов подозрения. Если вас часто принимают за шпиона, ваш ответ, скорее всего, выглядел хуже других.
Это и есть центральная идея: оценка качества текста превращается в задачу распознавания скрытого дефицита информации.
Почему это должно работать
Главный вопрос: правда ли подозрение в «шпионстве» связано с качеством текста? Может, игроки просто угадывают по поверхностным признакам.
Авторы специально проверяют именно это.
Они запускают 100 игровых эпизодов на задачах творческого письма и суммаризации. Для каждого ответа считают, сколько подозрительных голосов он набрал. А отдельно просят GPT-4o ранжировать ответы по качеству — от лучшего к худшему.
Получается почти прямой тест метода: если голосов больше, а качество ниже, то внутренняя награда действительно попадает в цель.
Именно это и видно на графике. Больше подозрений — хуже качество. Не идеально линейно, но связь стабильная. Для такого рода работ это важнее, чем красивое объяснение: внутренняя механика не просто существует, а согласуется с внешней оценкой.
Большая часть открытых задач сегодня учится либо по человеческим предпочтениям, либо по модели-судье. И там всегда есть риск, что вы оптимизируете не качество текста, а вкусы или слабости судьи.
SpyRL предлагает другой источник сигнала: игровую ситуацию, где правильный ответ встроен в саму среду.
Что делали в экспериментах
Авторы проверили метод на трёх типах задач:
🟠 Суммаризация длинных документов
🟠 Творческое письмо
🟠 Математическое рассуждение
В суммаризации и письме шпион видел текст с замаскированными фрагментами. В математике ему убирали часть контекста задачи. После этого все участники должны были выдать результат, а затем по этим результатам вычислить шпиона.
Обучение шло попеременно в двух режимах:
🟣 Сначала улучшается этап выполнения задачи
🟣 Потом улучшается этап распознавания шпиона
🟣 Затем цикл повторяется
Это важная деталь. Если одновременно обновлять и «исполнителя», и «детектор», система становится слишком нестабильной: один модуль меняет распределение ответов, другой в этот же момент пытается к нему приспособиться. Авторы показывают, что совместное обновление заметно хуже, чем попеременное.
Ещё одна техническая деталь — коррекция по ролям. У шпиона и у обычных игроков условия неравны: шпион изначально в худшей позиции. Поэтому сырые награды нельзя просто складывать вместе. Для этого в методе есть отдельная оценка преимущества по ролям, чтобы модель не училась наказывать себя просто за то, что оказалась шпионом.
Что получилось на практике
На открытых задачах эффект заметный.
В суммаризации SpyRL стабильно обходит базовые модели и два self-play-бейзлайна — R-Zero и Absolute Zero. На Qwen3-8B средняя победа над своей базовой версией в A/B-сравнениях доходит до 75,4%. Для Qwen3-4B — 73,9%.
В творческом письме картина ещё интереснее. На Qwen3-8B метод получает около 77,3% побед над базовой моделью на одном наборе и 78,1% на другом. Причём преимущество видно не только в «общем качестве», но и в более скользких категориях вроде новизны и эмоциональности.
Авторы отдельно проверили оценки у людей. Десять аспирантов сравнивали анонимные тексты моделей. SpyRL там тоже впереди почти по всем измерениям.
На математике метод тоже не проваливается, хотя там уже есть обычные проверяемые награды. Но и здесь SpyRL выигрывает. Для Qwen3-4B средний прирост по семи бенчмаркам составил 8,97%, для Qwen3-8B — 6,16%. Особенно заметны скачки на более сложных экзаменационных задачах вроде AIME.
Подход, придуманный для открытых задач, помогает и там, где проверяемые ответы уже были. Похоже, дело не только в наличии награды, но и в том, насколько она богата и конкурентна.
Что показали дополнительные разборы
Авторы сделали набор абляций, и там видно, за счёт чего метод держится.
🟠 Если обучать только этап выполнения задачи, без улучшения детектора, рост быстро выходит на плато.
🟠 Если обучать только детектор, целевая способность почти не улучшается.
🟠 Если убрать шпиона, то есть асимметрию информации, качество тоже быстро перестаёт расти.
🟠 Если убрать поправку на роль шпиона и обычного игрока, результаты местами падают даже ниже базовой модели.
Ещё одна полезная деталь — размер группы. Лучший скачок получается при переходе от 3 игроков к 5. Дальше отдача уменьшается.
Это хороший практический вывод: не нужно бесконечно раздувать мультиагентный сценарий. Достаточно добиться такой сложности игры, при которой ответы уже трудно отличать, но ещё можно стабильно учить детектор.
Почему это важно
Если вы обучаете модели на математике, всё более-менее понятно: есть проверяющий код, есть ответ, есть награда. Но большая часть интересных продуктовых задач живёт в другой зоне. Суммаризация, письмо, исследование, подготовка черновиков, длинные объяснения — там нет эталона в одну строку.
Сегодня индустрия в таких местах в основном опирается на три вещи:
🟣 Человеческие предпочтения
🟣 Наградные модели
🟣 Модели-судьи
У всех трёх подходов есть ограничения. Люди дорогие и медленные. Наградные модели наследуют смещения из обучающей выборки. Модели-судьи стоят денег на каждый инференс и часто оценивают хуже, чем хотелось бы.
RLSVR показывает другой маршрут: можно не искать идеального внешнего судью, а менять структуру самой задачи так, чтобы сигнал рождался из среды. Это не убирает все проблемы. Нужно аккуратно проектировать игру, следить, чтобы участники не начали использовать поверхностные признаки, и проверять, что игровая награда правда связана с качеством. Но направление здесь понятное и практическое.
Вывод
У открытых задач может появиться проверяемая награда, если правильно перестроить среду. В этом главный смысл RLSVR.
SpyRL делает это через простую механику: один участник видит испорченный вход, остальные — полный, а потом все пытаются вычислить шпиона по результату работы. Личность шпиона известна заранее, значит награда точная. При этом сама игра заставляет модель писать лучше, потому что плохой ответ выдаёт нехватку информации.
Из этого следуют три вывода.
🟠 Обучение с подкреплением не обязано ограничиваться математикой и задачами по программированию.
🟠 Открытые задачи можно учить без постоянной опоры на внешнего судью.
🟠 Преобразование задачи становится таким же важным инструментом, как архитектура модели или выбор алгоритма оптимизации.
Если вы хотите понять, куда может пойти следующее поколение самообучения LLM, смотреть стоит именно сюда: не только на более умных судей, но и на более умные игровые среды, где правильный сигнал рождается сам.
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram