论文

自承诺延迟:面向提示隐式黑客的无奖励探针

Self-Commitment Latency: A Reward-Free Probe for Prompted Implicit Hacking

模型评测评测方法与指标

摘要

当语言模型的思维链看起来良性时,隐式奖励黑客很难审计:最终答案可能由快捷捷径锚定,而书面推理仍然类似于普通的问题解决。基于验证器的探针通过测量早期截断推理上下文如何获得高奖励来暴露这种行为,但需要特定于任务的奖励信号。本文提出了一种较弱输入的替代方案,即自我承诺延迟,它衡量提示推理上下文多久承诺模型自己的最终答案。我们使用 Qwen2.5-3B-Instruct-4bit 在受控配对 GSM8K 设置中评估探头,将普通提示与包含答案提示的提示进行比较。与诚实的上下文相比,暗示的上下文更早地做出承诺,并且不确定性更低。主要延迟指标,即阈值 0.8 的首次提交延迟,达到 AUROC 0.878;支持全曲线摘要的承诺范围达到 AUROC 0.926,平均未承诺质量达到 0.904。当两个提示条件都正确回答并且在阈值范围内保持稳定时,信号更强。这些结果表明,捷径可用的推理上下文可以留下可检测的早期行为承诺签名,而无需奖励模型、外部判断或训练有素的分类器。