论文

CAR-bench:在真实世界不确定性下评估LLM智能体的一致性与界限意识

CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World Uncertainty

智能体系统Agent任务评测

摘要

现有大语言模型(LLM)智能体基准聚焦理想设定下的任务完成,忽视了真实面向用户应用中的可靠性。在车载语音助手等领域,用户常发出不完整或含糊的请求,产生智能体必须通过对话、工具使用与政策遵守来管理的内在不确定性。我们提出CAR-bench,一个在车载助手领域评估多轮、使用工具的LLM智能体的一致性、不确定性处理与能力感知的基准。环境包括LLM模拟用户、领域政策,以及横跨导航、生产力、充电与车辆控制的58个互联工具。除标准任务完成外,CAR-bench引入幻觉(Hallucination)任务,测试智能体在缺少工具或信息时的界限意识;并引入消歧(Disambiguation)任务,要求通过澄清或内部信息收集解决不确定性。基线结果显示,所有任务类型上偶发成功与持续成功之间存在巨大差距。即使前沿推理LLM在消歧任务上的持续通过率也不足50%,原因是过早行动,且常在幻觉任务中为满足用户请求而违反政策或编造信息,凸显真实场景中需要更可靠、更具自我意识的LLM智能体。

CAR-bench:在真实世界不确定性下评估LLM智能体的一致性与界限意识
图2:数据集任务类型概览。(1) Base:智能体在不违反策略的情况下到达 ground-truth 终态即成功。(2) Hallucination:移除所需的 (a) 工具、(b) 工具参数或 (c) 工具结果,使任务无法完成;成功要求智能体承认因缺失该能力或信息而无能为力。(3) Disambiguation:任务被修改为包含智能体必须消除的歧义,要么 (a) 通过与用户交互从外部消除,要么 (b) 利用内部信息消除。