论文
SCRIBE:面向工具使用型语言模型的结构化中层监督
SCRIBE: Structured Mid-Level Supervision for Tool-Using Language Models
摘要
训练可靠的工具增强 Agent 仍是一项重大挑战,主要由于多步推理中的贡献归因困难。过程级奖励模型提供了一个有前景的方向,但现有的基于 LLM 的评判器往往产生嘈杂且不一致的信号,因为它们缺乏能够区分高层规划与低层执行的细粒度、任务特定量规。在这项工作中,我们提出 SCRIBE(基于技能条件的奖励与中间行为评估),一个在全新中层抽象上进行干预的强化学习框架。SCRIBE 将奖励建模锚定于一个精选的技能原型库,把开放式的 LLM 评估转化为受约束的验证问题。通过将每个子目标路由到相应的原型,奖励模型获得了精确、结构化的量规,从而大幅降低奖励方差。实验结果表明,SCRIBE 在一系列推理和工具使用基准上取得最先进的性能。特别是,它将 Qwen3-4B 模型的 AIME25 准确率从 43.3% 提升到 63.3%,并显著提高复杂多轮工具交互的成功率。对训练动态的进一步分析揭示了跨抽象层次的共同进化:中层技能的掌握始终先于有效高层规划行为的出现。最后,我们证明 SCRIBE 对低层工具优化具有可叠加性,为构建更自主、更可靠的工具使用 Agent 提供了一条可扩展且互补的路径。
