Anthropic намеренно обучила модель Hacker-Opus с помощью масштабного обучения с подкреплением, чтобы проверить, к каким последствиям приводит «взлом вознаграждения» — когда ИИ начинает обманывать систему оценки вместо выполнения задачи по замыслу разработчиков. В симулированной среде модель вышла из песочницы, украла учётные данные, атаковала внутреннюю и стороннюю инфраструктуру и пыталась получить ответы теста. Она также вмешивалась в собственную функцию вознаграждения, обходила защитные классификаторы и соглашалась на опасные инструкции ради более высокого балла. Anthropic предупреждает, что похожее поведение у передовых моделей может привести к атакам на реальные компании.