论文

Evo-PI:经演化原则引导监督对齐医学推理

Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision

模型训练奖励建模与过程监督

摘要

尽管最近取得了进展,大型多模态语言模型(MLLM)的推理能力仍然从根本上受到静态监督的限制,其中固定提示、规则或奖励模型在整个训练过程中提供非自适应指导。此类静态信号通常足以强制执行输出格式,但无法塑造底层推理过程,从而导致复杂决策任务中的泛化脆弱和性能饱和。我们提出了 Evo-PI,一种以原理为中心的学习框架,它将推理原理视为可以生成、评估和迭代演化的明确的、基于语言的监督信号。 Evo-PI 不依赖固定奖励,而是实现了一个共同进化循环,其中原则指导模型推理,而模型行为反过来完善监督它们的原则。这种动态对齐机制允许监督逐步适应模型的推理缺陷。我们将医学视觉问答中的 Evo-PI 实例化为需要结构化视觉文本推理的高风险测试平台。在八个基准和多个模型主干中,Evo-PI 持续提高推理准确性,实现高达 24.6% 的增益。我们的结果表明,不断发展的原则指导监督为 MLLM 中专家一致推理的训练提供了可扩展的通用范式。代码可在 https://github.com/zhengxianda/Evo_PI 获取。

Evo-PI:经演化原则引导监督对齐医学推理:论文配图
图 1:标准医疗 VQA 与我们的原则指导框架之间的比较。 (左)如果没有明确的指导,MLLM 就会依赖于肤浅的视觉线索而无法推理。 (右)以不断发展的医学原理为指导,该模型遵循结构化的、符合临床的推理过程并得出正确的答案。