论文

ToolCompass:引导而非压制工具试错

Toolcompass: Guiding Tool Trialing, Not Suppressing It

智能体系统模型训练强化学习Agent 工具调用RLVRAgentic RL

摘要

大语言模型(LLM)智能体必须把训练时见过的工具泛化到部署时未见过的工具。一个关键挑战是工具试错(tool trialing):过度试错会浪费交互预算,而有选择的试错则能探索陌生工具。现有的基于结果的后训练对浪费性试错不加引导,而轮级监督可能压制必要的探索。我们提出 ToolCompass,一个通过按共享功能组织工具调用表征来引导工具试错的后训练框架。具体而言,ToolCompass 把每个功能类建模为 von Mises–Fisher 分布,联合缩小跨域的功能内差异、增大功能间分离。这一结构把经验从见过的工具迁移到功能相似的未见工具,引导探索远离无关选项。ToolCompass 无需真实调用轨迹或未见工具访问,也不带来推理开销。在 AppWorld 与 FTRL 上的实验显示,跨 GRPO、RFT 与 DMPO 均有一致收益:相对朴素后训练,AppWorld OOD 任务成功率最高提升 10.71 个百分点,且在两个基准上都优于各竞争基线。

ToolCompass:引导而非压制工具试错:论文配图
图 1:工具试用应当被引导而非被抑制。(a) 过度试用会耗尽交互预算去寻找所需工具“like_song”,而选择性试用则能够探索“add_product_to_wish_list”等陌生工具。(b) 在留出的 AppWorld 应用上,MatchTIR 的调用次数少于 GRPO,但任务成功率更低,揭示了抑制探索的代价。