i
ДАТАИСТ
К ленте

Обучение с подкреплением

RLHF, GRPO, DPO и прочие способы научить модель тому, чего нет в обучающих данных.

5 материалов

Улучшать нужно не модель, а интерфейс агента

В гонке за более умными агентами на базе LLM мы почти автоматически думаем о привычных рычагах: взять модель побольше, докрутить файн-тюнинг, добавить RL, переписать инструкцию. Но авторы работы Adapting the Interface, Not the Model предлагают неприятно простой вопрос: а что, если агент проваливается не потому, что «плохо думает», а потому что…

Всё, что нужно знать об обучении агентов простыми словами

Как обучение с подкреплением (RL) используется не только для «хорошего ответа», а для устойчивого поведения в динамических условиях. Ещё недавно обучение с подкреплением для LLM выглядело так: модели показывают промт, она выдаёт один ответ, и этот ответ «оценивают» — людьми или автоматическими метриками. Это отлично работает для подстройки стиля…

Когда данных нет совсем, а учиться всё равно нужно: как ИИ сам придумывает задачи и сам себя проверяет

В последние пару лет обучение рассуждению LLM делают через Reinforcement Learning with Verifiable Rewards (RLVR): модель решает задачу, получает награду, которую можно строго проверить, и постепенно начинает рассуждать лучше - так не нужно размечать цепочки рассуждений, достаточно уметь…

Увидел-указал-полетел: как управлять автономными дронами без обучения с нуля

Навигация по текстовым инструкциям — давний вызов для автономных дронов. Традиционные алгоритмы на основе обучения с подкреплением требуют больших датасетов и плохо переносятся на новые домены. Недавняя волна решений на базе визуально-языковых моделей обещала универсальность, но часто просила…

Как обучение с подкреплением перестраивает мышление LLM

Задачи на рассуждение — больное место многих ИИ-систем, даже если у них хорошие фактические знания. Новая работа показывает, что усиление через RL (Reinforcement Learning, обучение с подкреплением) не просто повышает точность, а перестраивает внутреннюю логику модели: появляется иерархия от…