论文

MAIGO:通过历史清理的 同策略 Self-蒸馏 减少对话中的迷失

MAIGO: Mitigating Lost-in-Conversation with History-Cleaned On-Policy Self-Distillation

摘要

大语言模型 通常根据完全指定的提示来解决任务,但当相同的要求在多个回合中展开时,任务就会降级,这称为对话中丢失 (LiC) 差距。我们将这种退化的部分原因追溯到自我污染:中间助理的回复进入后来的上下文,并将早期的偏差向前推进。受此机制的推动,我们提出了 MAIGO,一种 同策略 自 蒸馏 方法,该方法使用来自模型自身策略的历史清理引用来减少这种污染。对于中间回合,MAIGO 会删除先前的助理回复,同时保留用户可见的分片前缀;对于答案轮流,它从以完成的用户端对话为条件的配对全视图参考中提取。可靠性权重会降低与干净参考不一致的中转样本的权重。 MAIGO 不需要验证者奖励、状态标签或推理时间脚手架。在具有确定性验证器的 LiC 成对视图协议下,MAIGO 将 Qwen2.5-7B-Instruct SHARDED 精度从 52.8 提高到 66.1,将 SHARDED/FULL 比率从 66.5% 提高到 84.1%,同时将 FULL 精度保持在 2.3 点以内。这些结果表明,自污染是 LiC 间隙的可训练组成部分。