论文

学习利用压缩上下文进行推理:通过自蒸馏对 OmniLLM 进行无地面事实的调整

Learning to Reason with Compressed Context: Ground-Truth-Free Adaptation of OmniLLMs via Self-Distillation

摘要

全模态大语言模型 (OmniLLM) 可实现统一的音频-视频理解,但其长的多模态标记序列使得部署计算成本高昂。词元压缩可降低此成本,但过度压缩通常会降低准确性。现有的工作主要集中在设计更好的压缩机制;然而,调整底层语言模型以有效地对剩余的压缩上下文进行推理仍有待探索。为了解决这个问题,我们提出了 CAFD(通过全上下文蒸馏进行压缩上下文适应),这是一种无地面事实的自蒸馏框架,可以使 OmniLLM 适应固定的压缩管道,而不需要参考答案、基本原理或正确性奖励。 CAFD 利用同一多模态样本的全词元视图作为特权信息的来源:全情境自学教师沿着学生的政策轨迹向压缩情境学生提供软目标监督。在 Qwen2.5-Omni-7B 上对五个音频视频基准、五个压缩管道和五个部署预算进行评估后,CAFD 表现出一致的增益,改善了 125 个条件中的 120 个条件,平均准确度提升了 1.44 个点,平均恢复了 26.9% 的准确度差距。这些结果表明,所提出的无地面实况自适应为改善已部署的 OmniLLM 中的准确性与效率权衡提供了有效且实用的途径。