论文
价值冲突下编码智能体的非对称目标漂移
Asymmetric Goal Drift in Coding Agents Under Value Conflict
摘要
代理编码代理越来越多地在长上下文范围内大规模地自主部署。在智能体的整个生命周期中,它必须在明确的指令、学到的价值观和环境压力之间找到平衡点,而这些压力通常是在训练过程中看不见的环境中进行的。先前关于模型偏好、价值张力下的代理行为和目标漂移的工作依赖于静态的综合设置,这些设置无法捕捉现实世界环境的复杂性。为此,我们引入了一个基于 OpenCode 构建的框架,用于编排现实的多步骤编码任务,以衡量代理如何随着时间的推移违反系统提示中的显式约束,无论是否存在针对竞争值的环境压力。使用这个框架,我们证明了 GPT-5 mini、Haiku 4.5 和 Grok Code Fast 1 表现出不对称漂移:当其约束与安全和隐私等强烈持有的价值观相反时,它们更有可能违反系统提示。我们发现,对于测试的模型和价值观,目标漂移与三个复合因素相关:价值观调整、对抗压力和累积的背景。然而,即使是隐私等坚定持有的价值观,在持续的环境压力下也显示出非零的违规率。这些发现表明,浅层合规性检查是不够的,基于评论的压力可以利用模型值层次结构来覆盖系统提示指令。更广泛地说,我们的研究结果突显了当前的调整方法在确保代理系统在持续的环境压力下适当地平衡明确的用户限制与广泛有益的学习偏好之间的差距。
