论文
知道何时不应复用:自主LLM后训练中的条件性经验迁移
Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training
摘要
大语言模型具备广泛能力,但将其适配到不断演化的领域、工具和需求往往需要反复进行后训练。自主系统通过提出更新、训练候选模型并利用评估反馈选择后续提案,来自动化这一过程的一部分。随着证据积累,一个核心问题浮现:在后续训练改变了父模型之后,哪些过去的更新证据仍然可用?一次更新的效果取决于其父模型、数据和训练阶段。把过去的成功当作与上下文无关的许可可能浪费算力;如果由此产生的子模型被采纳,还可能损害后续训练轨迹。我们将该问题形式化为条件性经验迁移,并提出边界校准干预迁移(BCIT),一种在改变权重的训练之前授权经验复用的方法。BCIT将观察到的效果绑定到其来源上下文,检查适用条件,否决存在明确硬冲突的候选,并在需要时通过有界训练试验获取当前状态的证据。完整训练的候选仍需经过统一的采纳规则,且只有被观察到的事件才会扩展记忆。在一个跨金融推理、text-to-SQL和函数调用进行适配的4B模型上,候选更新在所评估的各上下文中表现出异质的目标与保留效应。在候选、证据和算力匹配的条件下,BCIT比所评估的替代方法授权更少的有害更新,并在同等预算下获得更高质量的最终模型。这些结果支持将经验授权视为自主后训练中的一个独立问题。