论文
ToolAnchor:锚定反事实上下文以提升智能体工具使用能力
ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability
摘要
工具增强的大语言模型智能体擅长长程任务,但它们通常在固定工具集上后训练。当任务需要新工具时,这些智能体难以有效纳入它们,而从零重训常不现实。我们把工具集扩展问题的核心障碍识别为行为惯性:智能体在已有新工具的情况下仍退回熟悉工具与既有推理模式的倾向。我们证明在关键决策点注入反事实锚上下文可以打破这种惯性——通过唤起被抑制的智能体能力挽救失败轨迹。为规模化该洞见,我们提出ToolAnchor:一个框架——教师模型假设这些反事实上下文、经学生rollout验证它们、并经智能体后训练内化成功干预。跨通用AI助手(GAIA)、文本搜索(BrowseComp)与视觉搜索(VDR-Bench)任务的大量评估显示:ToolAnchor在扩展工具集下持续展现有竞争力的表现。本工作弥合静态后训练与动态适应之间的鸿沟,为可扩展的智能体强化学习开辟新路径。
