论文

RecToolBench:模糊用户意图下的推荐工具编排基准

RecToolBench: Benchmarking Recommendation-Specific Tool Orchestration under Fuzzy User Intent

智能体系统智能体互操作协议Agent任务评测MCP

摘要

Agentic 推荐系统的最新进展正在将推荐系统从被动过滤引擎转变为使用外部工具来解析用户意图的指令跟踪代理。然而,现有的基准测试通常假设明确的用户意图、简化的工具环境或孤立的函数调用,从而导致推荐的实际工具编排尚未得到充分探索。为了弥补这一差距,我们提出了 RecToolBench,这是一种基于模型上下文协议 (MCP) 的基准,用于在模糊用户指令下评估使用工具的推荐代理。 RecToolBench 包含跨三个推荐域、13 个 MCP 服务器和 32 个工具的 1,200 多个可执行任务,涵盖单一工具调用、并行工具调用、顺序工具链和混合工具编排。我们构建了具有可扩展合成-模糊化-判断管道的RecToolBench,该管道生成可执行的模糊推荐任务,并使用基于规则的执行检查和基于规则的LLM评估来评估代理轨迹。对代表性大语言模型的实验表明,语法上有效的工具调用并不能保证推荐成功。模型在语义参数定位、多步骤证据集成和有证据支撑的最终建议方面遇到困难,尤其是随着编排复杂性的增加。我们的结果表明,模糊用户意图下的工具编排是Agentic 推荐系统的主要瓶颈。我们的数据和代码可在 https://github.com/ShawnChenn/RecToolBench 获取。

RecToolBench的数据合成与智能体评估流程,任务难度逐级增加。
图1(图注摘要):RecToolBench的数据合成与智能体评估流程,任务难度逐级增加。