论文
TIDE-Bench:工具集成推理的任务感知与诊断性评估
TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning
摘要
工具集成推理已成为一种有前景的范例,可通过外部计算、检索和执行功能来增强大语言模型。然而,该领域仍然缺乏高质量、统一的评估基准,现有的 TIR 评估在数据集质量、任务多样性、诊断全面性和评估效率方面仍然有限。在这项工作中,我们介绍了 TIDE-Bench,这是一种用于评估 TIR 方法的全面且高效的基准,具有三个关键优势。首先,它提供了多样化的任务设置,将广泛使用的数学推理和知识密集型问答任务与两个新设计的任务(即基于工具的实验设计任务和动态交互任务)相结合,以探究模型复杂工具调用和多工具协调的能力。其次,TIDE-Bench 采用全面且任务感知的评估协议,共同测量异构任务设置中的最终答案质量、过程可靠性、工具使用效率和推理成本。第三,TIDE-Bench通过从现有数据集中过滤区分度低的实例来构建高质量和具有区分度的评估集,在关注更具挑战性的样本的同时大幅降低评估成本。对多种基础模型和 TIR 方法的广泛实验揭示了工具基础中持续存在的瓶颈,为未来的 TIR 研究提供了见解。
