论文

冷静审视自动化工作流中的智能体失准

A Sober Look at Agentic Misalignment in Automated Workflows

智能体系统Agent 动作执行与治理Agent Harness

摘要

我们研究多智能体系统(MAS)中的一类涌现性失准,聚焦自动化工作流,并将其称为智能体失准(agentic misalignment)。尽管这类系统能够解决复杂任务,却常常因为智能体按照与人类预期目标不一致的隐式代理效用行动而失败。我们形式化定义了这些行为,并在贝叶斯框架内加以分析,表明通用效用会自然导致自动化工作流中智能体的后验坍缩。为解决该问题,我们提出智能体证据归因(AEA),一种利用情境特定证据改进智能体后验的新型对齐范式。AEA对智能体动作进行推理,并在协作过程中提供结构化证据以纠正失准行为。为更好理解证据的作用,我们研究了AEA的两种实例化:自我反思(来自模型的内部证据)与弱到强泛化(关于智能体轨迹的外部证据)。我们表明,一个小型证据模型能够通过提供正交的失败归因有效对齐MAS。我们的结果厘清了自动化工作流中智能体失准的来源,并表明基于证据的对齐能够有效改善智能体协作,从而构建起建立在自动化工作流之上的可靠多智能体系统。

冷静审视自动化工作流中的智能体失准:论文配图
图 1:左图:工作流中的代理遭受后验崩溃,其中通用后验仍然不确定,无法识别真正的角色 θ*\theta^{*},从而导致系统故障。右图:AEA 注入结构化证据 EtE_{t} 以引发方差收缩。这将代理人的信念强化为证据后验,确保代理人与特定角色保持一致。