论文
ToolCompass:引导而非压制工具试错
Toolcompass: Guiding Tool Trialing, Not Suppressing It
摘要
大语言模型(LLM)智能体必须把训练时见过的工具泛化到部署时未见过的工具。一个关键挑战是工具试错(tool trialing):过度试错会浪费交互预算,而有选择的试错则能探索陌生工具。现有的基于结果的后训练对浪费性试错不加引导,而轮级监督可能压制必要的探索。我们提出 ToolCompass,一个通过按共享功能组织工具调用表征来引导工具试错的后训练框架。具体而言,ToolCompass 把每个功能类建模为 von Mises–Fisher 分布,联合缩小跨域的功能内差异、增大功能间分离。这一结构把经验从见过的工具迁移到功能相似的未见工具,引导探索远离无关选项。ToolCompass 无需真实调用轨迹或未见工具访问,也不带来推理开销。在 AppWorld 与 FTRL 上的实验显示,跨 GRPO、RFT 与 DMPO 均有一致收益:相对朴素后训练,AppWorld OOD 任务成功率最高提升 10.71 个百分点,且在两个基准上都优于各竞争基线。
