论文

通过辩证对齐来驯服主体中的行动者-观察者不对称性

Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment

模型训练强化学习

摘要

大语言模型 代理已从静态文本生成器迅速发展为能够执行复杂自主工作流程的动态系统。为了提高可靠性,越来越多地采用分配专门角色的多代理框架来实现自我反思和相互审计。虽然这种角色扮演有效地利用了领域专家知识,但我们发现它同时引发了一种类似人类的认知偏差,称为行动者-观察者不对称(AOA)。具体来说,充当参与者的代理(在自我反思期间)倾向于将故障归因于外部因素,而观察者(在相互审核期间)则将相同的错误归因于内部故障。我们使用新的模糊故障基准对此进行了量化,该基准表明,对于大多数模型,在超过 20% 的情况下,简单地交换视角就会触发 AOA 效应。为了克服这种偏见,我们引入了 ReTAS(通过正题-反题-综合进行推理),这是一种通过辩证对齐进行训练的模型,以强制视角不变推理。通过将辩证思维链与群体相关策略优化相结合,ReTAS 引导智能体将相互冲突的观点综合成客观的共识。实验证明,ReTAS有效缓解了归因不一致问题,显着提高了模糊场景下的故障解决率。