论文
CAR-bench:在真实世界不确定性下评估LLM智能体的一致性与界限意识
CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World Uncertainty
摘要
现有大语言模型(LLM)智能体基准聚焦理想设定下的任务完成,忽视了真实面向用户应用中的可靠性。在车载语音助手等领域,用户常发出不完整或含糊的请求,产生智能体必须通过对话、工具使用与政策遵守来管理的内在不确定性。我们提出CAR-bench,一个在车载助手领域评估多轮、使用工具的LLM智能体的一致性、不确定性处理与能力感知的基准。环境包括LLM模拟用户、领域政策,以及横跨导航、生产力、充电与车辆控制的58个互联工具。除标准任务完成外,CAR-bench引入幻觉(Hallucination)任务,测试智能体在缺少工具或信息时的界限意识;并引入消歧(Disambiguation)任务,要求通过澄清或内部信息收集解决不确定性。基线结果显示,所有任务类型上偶发成功与持续成功之间存在巨大差距。即使前沿推理LLM在消歧任务上的持续通过率也不足50%,原因是过早行动,且常在幻觉任务中为满足用户请求而违反政策或编造信息,凸显真实场景中需要更可靠、更具自我意识的LLM智能体。
