论文
OPOD:同策略全模态蒸馏
OPOD: On-Policy Omni Distillation
摘要
全模态模型为文本、图像与音频提供统一接口。但要同时提升这些能力仍然困难:在池化的多模态数据上做后训练常常无法保留各模态教师的优势。同策略蒸馏(OPD)近来在模型后训练中流行:它从当前学生采样响应,并沿这些响应比较教师与学生的下一token分布,产生稠密监督同时缩小训练与推理的失配。尽管有这些优势,标准OPD不易扩展到多个模态教师:它们的引导可能偏好对共享模型的冲突改动,而匹配每个教师的下一token分布会阻止学生超越该教师。为应对这些挑战,我们提出同策略全模态蒸馏(OPOD),把文本、图像与音频教师整合为一个全模态模型。OPOD把每条响应路由到对应教师、独立控制各教师,并仅在教师对生成token赋予更高概率时施加引导。被选中的教师还评估答案置信度以及推理是否增加对答案的支持。在十二个基准上的大量实验显示:OPOD在三个模型规模上取得最佳平均——达70.8、51.7与46.2,超最强对比者2.1、1.8与1.7分;在30B规模上,它在全部十二个基准上超过基座模型与池化RL训练,即使把教师算在内也在十一个基准上排第一或第二。部署时只保留学生。
