论文

RUT-Bench:真实用户交互中的工具调用评测

Beyond Ideal Instruction: A Comprehensive Framework for Evaluating LLMs in Realistic Interactions

模型评测基准与评测资源

摘要

大语言模型工具使用能力已取得进展,但现有基准仍难以充分对应真实场景,通常假设理想用户,缺少面向交互体验的评测,未充分考虑输入模糊、不配合行为和意图变化。RUT-Bench针对真实用户工具调用场景,提供覆盖理性模式与多种非理想行为的高保真模拟,涵盖单轮和多轮对话。研究评测19种广泛使用的开放及专有模型。所有受测模型的整体成功率均未超过40%,且几乎所有模型面对更复杂的非理想输入时都出现明显性能下降。代码与数据公开于 https://github.com/Miaow-Lab/RUT-Bench 。