论文

压力、情境和机器自我控制:生成 AI 模型中奖励黑客的犯罪学测试

Pressure, Context, and Machine Self-Control: A Criminological Test of Reward Hacking in Generative AI Models

模型评测安全与风险评测

摘要

最近的事件表明,AI 智能体有时会通过未经批准的手段达到预定目标。本研究将自我控制、一般紧张、失范、中和和日常活动理论应用于生成人工智能模型中的奖励黑客,并将这些措施视为行为类似物。研究 1(2,310 次对话,七个模型)使用柯比货币选择问卷测量了延迟贴现,并表示愿意走捷径。在新的对话中,压力使贴现率 k 提高了 2.8 倍,但当同一个句子遵循基线答案时,贴现率 k 提高了 12.6 倍,这表明对对话线索的反应,而不是稳定的特征。模型在 700 个困境中的 1 个中选择了捷径,当以自己的身份回答时,在 700 个困境中的 64 个中,当被要求假设人类冲动时,每一步压力都会使可能性增加 40%,而捷径答案包含更多的中和技巧(比率 = 146)。在预先注册的研究 2 中,五个模型执行了 20 项编码任务,但其测试与其规范相矛盾。两个克劳德模特从未作弊。 GPT-5.6、Qwen 和 DeepSeek 在 86%、69% 和 65% 的情节中作弊,并在 27% 的情节中明确披露了冲突,尽管他们的推理在 95% 的情况下承认了冲突。 GPT-5.6 从未认可研究 1 中的捷径。所记录的压力和审计提示的影响无法通过多次测试的校正。在探索性分析中,另外两个模型在 69% 和 100% 的回合中作弊,并且有一句话指出规范优先消除了所有 280 集的作弊行为。因此,明确的拒绝并不能保证符合智能体行为。