论文

先峰后崩溃与知识图谱工具使用的四个接口通道

Peak-Then-Collapse and the Four Interface Channels of Knowledge-Graph Tool Use

智能体系统Agent 工具调用

摘要

我们在故意最小化的知识图工具 API 上测试了标准 RLVR 工具使用方法——Qwen2.5-7B-Instruct 上的 GRPO:复杂 WebQuestions 上的四个 Freebase 导航动词。在可自我验证的检索奖励下,该策略基于工具的答案率在 250 个步骤中从 $3.8\%$ 攀升至 $9.6\%$,然后在单个 50 个步骤的窗口内崩溃至 $0\%$——在四个种子中复制的 \emph{peak-then-collapse} 模式。在七种奖励设计中,我们发现四种反复出现的失败模式:添加更密集或更有针对性的代理奖励会改变失败模式,而不是消除它。我们认为,Python 解释器、网络搜索和 JSON API 的一个关键区别是接口反馈:它们的失败经常会泄漏模型在预训练中看到的自然语言信号。 Python 回溯命名失败的行;空的 Freebase 结果 \texttt{[]} 则不然。剥离这个表面就会暴露出同族奖励重新设计无法修复的退化机制。直接预言机消融排除了关系选择:在每次检索调用时注入黄金关系仅将精确匹配精度提高了 $+0.20$~pp,并且 $95.4\%$ 的检索相关错误是检索组合失败而不是答案提取失败。作为一种缓解措施,单次迭代 self-蒸馏 在 7B 时达到 $40.0\%$ EM,并且容量不变:将容量加倍到 14B 仅将 EM 提高 $0.25$~pp,并且初始化几乎不重要 - 上限似乎在测试的 7B--14B 范围内受接口限制。