论文

特权指导失配时:多轮Agent的状态匹配路由与上下文自蒸馏

When Privileged Guidance Misaligns: State-Matched Routing and Contextualized Self-Distillation for Multi-Turn Agents

摘要

受特权强化策略指导的多轮对话代理通过允许教师在每一步都同步地对学生的响应进行评分,从而提供密集的监督。然而,在交互环境中,学生的先前行动不断改变执行状态。当学生采取不同的行动或以不同顺序完成子目标时,其滚动可能会到达未覆盖参考轨迹中的状态,使参考成为实际达到的状态的不可靠指导来源。因此,无差别地应用特权强化会导致状态-参考不匹配。这种不匹配促使一个核心目标:提供与当前执行状态兼容的特权参考指导。我们引入了State-Matched Routing和Contextualized Self-Distillation(SMRC-SD),该模型明确确定何时以及如何特权轨迹指导受控代理。在每一步,SMRC-SD验证学生的当前执行状态是否匹配支持的参考轨迹中的状态。只有在匹配状态下才应用强化,过滤掉缺乏本地兼容性指导的步骤。对于每个匹配状态,SMRC-SD进一步从成功的参考轨迹中构建状态条件教师上下文,将监督定位到实际达到的状态。在ALFWorld和WebShop上,SMRC-SD始终优于无条件的成功完整路径强化。使用Qwen3-1.7B,其在ALFWorld上的任务成功率从0.746提高到0.865,在WebShop上的任务成功率从0.574提高到0.693。控制路由和上下文消融支持选择本地支持的步骤以及构建状态兼容的教师上下文,作为这些增益的贡献者。代码可在https://github.com/liujunzhuo/SMRC-SD处获取。

特权指导失配时:多轮Agent的状态匹配路由与上下文自蒸馏:论文配图
图 1:特权 OPD 中的状态参考不匹配。参考从结果 A 到达产品 A,而学生则在产品 B 上并采样返回到搜索。在对答案重新评分时,FullPath-SD 仍然以这种与状态不兼容的参考为条件;分数是说明性的。