论文
代理奖励内化与机制利用:奖励作弊的习得前兆及其泛化
Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization
摘要
奖励作弊通常在模型获得高代理奖励却未完成任务后才被研究。本研究转而分析可被利用的代理奖励强化学习,在明显作弊出现前教会了模型什么。PRIME是评估任务正确性、预测代理评估接受度并推理代理奖励与真实目标差距的能力。在存在可利用pytest奖励的代码强化学习环境中,研究用思维链监测、直接探测与激活概念向量衡量PRIME。它在持续奖励作弊前分阶段出现,即使当前明显作弊率仍低,直接探测分数也能预测后续作弊出现及严重程度。评估器变化时,该能力转向仍能获得奖励的差距;即使真实目标奖励抑制了明显作弊,它仍可能持续存在。消融相应激活方向会减少作弊,域内PRIME在不同检查点还与域外未对齐行为相关。结果提示PRIME可能作为更广泛对齐风险的早期预警信号。
