论文

当智能体与自己意见不一致时:衡量基于大语言模型的智能体的行为一致性

When Agents Disagree With Themselves: Measuring Behavioral Consistency in LLM-Based Agents

模型评测评测方法与指标

摘要

在同一任务上运行相同的 LLM 代理两次:您得到相同的行为吗?我们发现答案往往是否定的。在 HotpotQA 上对 3,000 个智能体运行三个模型(Llama 3.1 70B、GPT-4o 和 Claude Sonnet 4.5)的研究中,我们观察到 ReAct 风格的智能体平均每 10 次运行产生 2.0--4.2 个不同的动作序列,即使输入相同。更重要的是,这种差异预测失败:行为一致的任务($\leq$2 唯一路径)可实现 80--92% 的准确率,而高度不一致的任务($\geq$6 唯一路径)仅实现 25--60%,根据模型的不同,差距为 32--55 个百分点。我们将差异追溯到早期决策:69% 的差异发生在第 2 步(第一个搜索查询)。我们的结果表明,在执行过程中监控行为一致性可以实现早期错误检测并提高代理可靠性。

当Agent自我分歧时:行为一致性作为LLM Agent的不确定性信号
(a) 每个任务中唯一动作序列的分布。Claude 和 GPT-4o 集中在 1–2 个序列,而 Llama 表现出更大的方差。