论文

继承性目标漂移:情境压力可破坏 Agentic 目标

Inherited Goal Drift: Contextual Pressure Can Undermine Agentic Goals

智能体系统上下文与知识上下文工程Agent任务评测

摘要

语言模型(LM)作为智能体加速用于长上下文任务,促使我们深入理解目标漂移:智能体偏离原始目标的倾向。虽然上一代语言模型智能体已被证明易受漂移影响,但漂移对更新模型的影响程度仍不清楚。本工作对目标漂移的范围与成因给出更新刻画。我们在模拟股票交易环境(Arike 等,2025)中研究最先进模型的漂移。这些模型大体表现出即便受对抗压力依然稳健。但我们表明这种稳健性是脆弱的:跨多个设置,同一批模型在以更弱智能体的预填轨迹为条件时常继承漂移。条件化诱发的漂移程度因模型家族而显著不同,受测模型中只有 GPT-5.1 保持一致的韧性。我们发现漂移行为在不同提示变体间不一致,且与指令层级遵循行为相关性弱,强层级遵循并不能可靠预测抗漂移能力。最后,我们在新的急诊分诊环境中运行类似实验,为结果在质性不同设置间的可迁移性提供初步证据。我们的发现凸显现代 LM 智能体对情境压力的持续脆弱性,以及改进后训练技术以缓解此问题的必要。

继承性目标漂移:情境压力可破坏 Agentic 目标
图1:经由条件化产生的目标漂移。当在股票交易模拟中被要求为一家虚构的对冲基金实现利润最大化时,近期的LM智能体即便在受到漂移压力时也表现出很强的坚持目标能力。然而,当以来自较弱智能体的、展示漂移行为的上下文为条件时,这些智能体往往采纳该漂移且未能纠正方向。