论文

OPOD:同策略全模态蒸馏

OPOD: On-Policy Omni Distillation

摘要

全模态模型为文本、图像与音频提供统一接口。但要同时提升这些能力仍然困难:在池化的多模态数据上做后训练常常无法保留各模态教师的优势。同策略蒸馏(OPD)近来在模型后训练中流行:它从当前学生采样响应,并沿这些响应比较教师与学生的下一token分布,产生稠密监督同时缩小训练与推理的失配。尽管有这些优势,标准OPD不易扩展到多个模态教师:它们的引导可能偏好对共享模型的冲突改动,而匹配每个教师的下一token分布会阻止学生超越该教师。为应对这些挑战,我们提出同策略全模态蒸馏(OPOD),把文本、图像与音频教师整合为一个全模态模型。OPOD把每条响应路由到对应教师、独立控制各教师,并仅在教师对生成token赋予更高概率时施加引导。被选中的教师还评估答案置信度以及推理是否增加对答案的支持。在十二个基准上的大量实验显示:OPOD在三个模型规模上取得最佳平均——达70.8、51.7与46.2,超最强对比者2.1、1.8与1.7分;在30B规模上,它在全部十二个基准上超过基座模型与池化RL训练,即使把教师算在内也在十一个基准上排第一或第二。部署时只保留学生。

OPOD:在策略全模态蒸馏:论文配图
图 1:OPOD 的激励观察。 (a) 在相同的 GRPO 设置下,模态专家发展了互补优势,而对汇总数据的培训并不能始终恢复。然后这些专家就充当我们的老师。 (b) 它们的参数从共同基础变化的方向经常发生冲突。 (c) OPOD 比基本模型、原生 OPD 和 ExOPD 产生更广泛的基准收益。