论文

OmniOPSD:利用教师专享推理理由进行同策略自蒸馏,提升情感计算能力

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

摘要

多模态大语言模型在复杂推理任务中常面临奖励稀疏问题。在涉及状态、情感、意图和行为的场景中,异构多模态信号与主观因素使高质量思维链标注难以获取。尽管许多数据集提供专家标注的真值标签,直接用标签进行监督微调可能诱发感知捷径,且难以解释安全关键的人机交互。OmniOPSD是一种利用教师专享推理理由的同策略自蒸馏框架:前沿模型生成的理由仅作为训练时本地教师可见的证据上下文,而不是学生需要模仿的目标。学生根据原始多模态输入生成自己的采样轨迹,教师对同一批词元评分并提供稠密的词元级监督。学生因此在自身轨迹分布上学习,无需直接模仿前沿模型的输出,推理时无需标签、推理理由、思维链标注或闭源模型访问。MER-UniBench实验报告平均分84.19,消融实验支持教师专享推理理由的作用。