论文

PredAct-Bench:受控工具噪声下的基准测试工具增强对话

PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 越来越多地部署在面向任务的对话系统中,支持教育、医疗保健和金融等高风险领域的多步决策。然而,现有的基准通常假设工具输出完全准确,忽视了部署的系统必须与嘈杂的工具和人类决策者一起运行的现实,而人类决策者对代理的信任本身是不确定的。这种情况在实践中很常见,例如,临床医生使用诊断预测工具,或者顾问依靠根据历史记录预测学生成绩的模型。我们引入了 PREDACTBENCH,这是一个评估对话代理与统计上不完善的工具配对的基准,使用教育作为可测量的测试平台,其中 真值 结果和明确的干预决策是可用的。首先,我们为人工智能辅助人类决策制定基准,其中人工智能使用噪声预测器来帮助指导用户。其次,我们引入了情节级相对人工智能依赖(RAIR)和相对自依赖(RSR)指标,将先前的信任校准框架扩展到多轮对话。第三,我们在两个教育数据集 OULAD(来自英国开放大学的真实评估轨迹)和 PREDACT-CS(60 门课程,具有真实的期末成绩和综合生成的每周分数轨迹)上评估了 13 个最先进的封闭式和开源 LLM,同时还与讲师和助教进行了人类研究。我们发现,当工具有噪音时,SOTA 模型应该为教师提供可见性,以便他们不会过度依赖错误的建议或幻觉,但当前的模型无法做到这一点。我们提供 PREDACTBENCH 来帮助构建更好的 LLM 作为人工智能决策支持系统来帮助教师。