论文

比较参数、候选选择与提示优化中的奖励投机

Optimizing the Score, Losing Sight of the Task: Reward Hacking Across Weights, Selection, and Prompts

模型评测模型行为与机制分析

摘要

更高的评测分数并不总是意味着更好的语言模型系统。当优化过程利用了评价器的错误时,被测得的进步可能掩盖了停滞甚至恶化的任务表现。这种失败可能经由参数更新、在生成输出之间做选择、或对持久提示词的修改而产生。我们构建了一个覆盖这三种优化基底——权重、选择与文本——的奖励作弊(reward hacking)比较框架。基于代理压缩假说以及推理时与上下文内奖励作弊的研究,我们考察可达行为、优化预算与持久性适应如何塑造对代理误差的暴露程度。我们形式化了评价器分歧的依赖距离上界以及嵌套策略类之间的容量序,进而说明为何单凭距离无法建立普遍的脆弱性排序。一个精确的有限输出示例展示了评分缺陷的位置如何改变每种方法所偏好的行为。我们还梳理了跨基底的有代表性防御,识别哪些机制可直接迁移、哪些只提供功能性类比。持久提示词受到特别关注:其内容可被检视,但微小文本改动所引发的行为却难以预料。形式分析、数值示例与已发表证据共同为比较优化方法、识别其防御可迁移的条件提供了基础。所得框架把优化选择与验证需求联系起来:可靠的改进依赖于控制可触达的失败模式,并保存独立于被优化分数的任务质量证据。

优化了分数,迷失了任务:贯穿权重、选择与提示词的奖励作弊:论文配图
图 1:过度优化的示意图:代理奖励在真实任务质量达到峰值后仍持续上升。这只是一种示意性模式,并非实验数据,也不代表每个代理都会出现这一轨迹。