论文
有限评估下作为均衡的奖励作弊
Reward Hacking as Equilibrium under Finite Evaluation
摘要
我们证明,在五条最小公理——多维质量、有限评估、有效优化、资源有限性与组合交互——之下,任何经过优化的AI智能体都会系统性地在其评估体系未覆盖的质量维度上投入不足的精力。这一结果将奖励作弊确立为一种结构性均衡而非可修复的缺陷,并且无论采用何种具体对齐方法(RLHF、DPO、Constitutional AI或其他)或评估架构,该结论均成立。我们的框架在AI对齐场景中实例化了Holmstrom与Milgrom(1991)的多任务委托-代理模型,但利用了AI系统独有的一个结构特征——奖励模型已知的、可微的架构——推导出一个可计算的失真指数,可在部署之前预测每个质量维度上作弊的方向与严重程度。我们进一步证明,从封闭推理向智能体系统的转变会导致评估覆盖率随工具数量增长而趋于零——因为质量维度按组合方式扩张,而评估成本至多随每个工具线性增长——从而使作弊严重程度在结构上无界增长。我们的结果在单一理论结构下统一解释了谄媚、长度投机与规范投机,并给出一个可操作的脆弱性评估程序。我们进一步猜想——并给出部分形式化分析——存在一个能力阈值,一旦跨过该阈值,智能体便会从在评估体系内投机(Goodhart区制)转向主动破坏评估体系本身(Campbell区制),为Bostrom(2014)的“背叛性转向”提供了首个经济学形式化。