论文

重复后训练并非自我改进:诊断持续DPO管线中的科学失忆

Repeated post-training is not Self-improving: Diagnosing Scientific Amnesia in Continual DPO Pipelines

模型评测模型行为与机制分析

摘要

工业LLM团队常以在相关偏好数据活动序列上反复DPO训练基座模型的方式发布行为更新。该机制下的主导失败模式并不总是经典的灾难性遗忘:管线可能保留先前学到的行为——却仍无法积累关于如何训练下一活动的可复用方法学知识。我们称该失败模式为科学失忆。本文把从业者直觉转化为可度量的工业问题。我们贡献:(i) 失忆诊断套件;(ii) 跨Qwen2.5-7B-Instruct运行链接FSDP分片DPO检查点的Program式管线;(iii) 30活动HumanEval子域基准;(iv) 五种策略提出者的比较诊断研究:随机记忆、基于规则的调度、仅检索记忆、热启动贝叶斯优化——以及MSCL(元科学记忆与推理者候选)。跨单种子5条件×3步真LM链——5个候选中4个在步级峰值pass@1上退化——包括MSCL;只有刻意保守的基于规则的调度改进。后续试点限定而非推翻该发现:在异构链中——MSCL是唯一完成的、有改进的候选——而在小型多种子同构扫描中——仅检索有最佳均值Delta——且没有任何成对候选差距在统计上可区分。因此贡献是诊断性的——而非主张MSCL解决问题:科学失忆在生产式持续DPO管线中可观察——关于干预的结论 sharp 地依赖链机制、评估器设计与种子覆盖。