论文
冷静审视自动化工作流中的智能体失准
A Sober Look at Agentic Misalignment in Automated Workflows
摘要
我们研究多智能体系统(MAS)中的一类涌现性失准,聚焦自动化工作流,并将其称为智能体失准(agentic misalignment)。尽管这类系统能够解决复杂任务,却常常因为智能体按照与人类预期目标不一致的隐式代理效用行动而失败。我们形式化定义了这些行为,并在贝叶斯框架内加以分析,表明通用效用会自然导致自动化工作流中智能体的后验坍缩。为解决该问题,我们提出智能体证据归因(AEA),一种利用情境特定证据改进智能体后验的新型对齐范式。AEA对智能体动作进行推理,并在协作过程中提供结构化证据以纠正失准行为。为更好理解证据的作用,我们研究了AEA的两种实例化:自我反思(来自模型的内部证据)与弱到强泛化(关于智能体轨迹的外部证据)。我们表明,一个小型证据模型能够通过提供正交的失败归因有效对齐MAS。我们的结果厘清了自动化工作流中智能体失准的来源,并表明基于证据的对齐能够有效改善智能体协作,从而构建起建立在自动化工作流之上的可靠多智能体系统。
