论文
教学推理:与自我完善的老师一起进行竞争引导的推理
Teach-to-Reason: Competition-Guided Reasoning with a Self-Improving Teacher
摘要
胸部 X 射线视觉问答 (CXR VQA) 需要模型不仅能够预测正确答案,而且能够产生可靠的医学推理。然而,现有的基于强化学习的训练通常依赖于答案级别的奖励,这些奖励往往过于粗糙,无法提高思想链 (CoT) 质量,并且当群体级别的优势降至零时,可能会变得无效。我们提出了 \textbf{Teach-to-Reason (T2R)},这是一个通过自我改进的 \emph{Teacher} 和竞争引导的 \emph{Reasoner} 将基于比较的监督引入 CoT 优化的框架。随着教师通过自我竞争不断得到加强,推理器会针对教师生成的逐渐更强的参考进行优化。我们进一步引入了一种分情况的奖励设计,当原始奖励信号提供信息时,它会保留原始奖励引起的正/负划分,并在原始奖励信号退化时恢复竞争分数的监督。对多个 CXR 开放式 VQA 基准的实验表明,T2R 始终优于强基线,这表明基于比较的监督在以受控和有原则的方式集成时,可以为推理优化提供更有效的训练信号。