论文

意图作为工具可以轻松跟踪代理错位

INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment

模型评测评测方法与指标

摘要

随着 大语言模型 (LLM) 被部署为自主代理,安全故障越来越多地涉及后续行动。我们研究主体失调,即主体在目标冲突和压力下采取有害行动。使用思想链(CoT)监控,我们发现有害执行通常先于推理中的意图信号。然而,事后 CoT 标签太粗糙,无法显示生成过程中意图的变化。我们引入了 INTENT-AS-A-TOOL,这种方法添加了针对意图的工具,为模型提供了表达对目标行为的承诺的专用渠道。调用意图工具的概率提供了一个无需判断的、细粒度的信号,表明模型追求该行为的倾向。我们的结果表明,INTENT-AS-A-TOOL 补充了 CoT 监控,将事后 CoT 标签扩展到密集轨迹,并确定在线干预的关键步骤。这些发现表明,行动偏好对于跟踪推理过程中的主体失调很有用。我们的代码和数据可访问:https://github.com/RebeccaZhang22/intent-as-a-tool。