论文
对使用工具的代理进行持续的教师锚定
Persistent Teacher Anchoring for Tool-Using Agents
摘要
蒸馏 在 LLM 后训练 中很常见,其中 同策略 知识蒸馏 (OPKD) 使用学生生成的轨迹来帮助学生为下游 RL 做好准备。在每个状态,学生都会匹配老师提供的下一个词元分布。随着轨迹采样进入教师不会访问的状态,师生分布差距会累积。在工具使用中,这种差距变得很重要,因为学生编写的调用在监督之前执行,而他们的观察结果后来形成了前缀。提议者-验证者生成通过让教师决定在生成过程中保留哪些学生提议的文本来解决这种偏差。现有的公式控制文本,但将工具执行留在其范围之外。我们提出持久教师锚定(PTA),这是一种由学生引发但教师承诺的轨迹生成结构。 PTA 保留了块级验证并添加了回合级承诺,仅在教师验证了整个回合后才允许调用到达环境。将经过验证的块视为原子生成单元,我们引入了持久前瞻,它通过在固定验证器下推进未来样本并在学生更新中携带未完成的样本来填充空闲的轨迹采样容量。在 Search-R1 式检索和 DeepEyes 式感知 RL 中,在相同的下游 RL 预算下,在下游 RL 之前应用 PTA 将宏 best@4 比 OPKD 提高了 2.5 和 2.8 个点,而前瞻将吞吐量提高了 24%。