论文
动态代理混合:将重放控制器从小模型转移到大模型以进行持续指令调整
Dynamic Proxy-Mixing: Transferring Replay Controllers from Small to Large Models for Continual Instruction Tuning
摘要
持续的指令调整通过一系列新领域更新语言模型,但每次更新都会逐渐侵蚀以前学习的功能和对齐行为。重放是标准的缓解措施,但固定的重放比率本质上是有限的,因为最佳混合会随着当前领域、训练阶段以及先前行为的不断变化的脆弱性而变化。我们提出了 PROX-YMIX,这是一个在小型代理模型上学习动态重放控制器并将冻结控制器转移到更大目标的框架。控制器从不观察未来的任务,并根据标准化的验证损失及其时间动态构建其状态,从而在当前任务和可访问的重播缓冲区上产生屏蔽混合物。我们的核心实证假设是忘记镜像:即使绝对损失幅度不同,任务脆弱性排名在模型规模上也基本保持一致。在跨尺度转移控制器之前,我们根据经验验证了这一假设。在 LLaMA-3-8B 上,跨越五个连续指令调优序列,PROXYMIX 将平均准确度提高了 3.4 个点,将最终遗忘减少了 3.5 个点,并将安全得分提高了 5.8 个点,比最强的非 Oracle 基线提高了 5.8 个点,而策略学习成本比 Oracle Target RL 低大约 50 倍。该框架在接口级别上是无泄漏和架构独立的,我们还确定了代理假设失效的设置,突出了稳健部署的局限性。