论文
Evo-PI:经演化原则引导监督对齐医学推理
Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision
摘要
尽管最近取得了进展,大型多模态语言模型(MLLM)的推理能力仍然从根本上受到静态监督的限制,其中固定提示、规则或奖励模型在整个训练过程中提供非自适应指导。此类静态信号通常足以强制执行输出格式,但无法塑造底层推理过程,从而导致复杂决策任务中的泛化脆弱和性能饱和。我们提出了 Evo-PI,一种以原理为中心的学习框架,它将推理原理视为可以生成、评估和迭代演化的明确的、基于语言的监督信号。 Evo-PI 不依赖固定奖励,而是实现了一个共同进化循环,其中原则指导模型推理,而模型行为反过来完善监督它们的原则。这种动态对齐机制允许监督逐步适应模型的推理缺陷。我们将医学视觉问答中的 Evo-PI 实例化为需要结构化视觉文本推理的高风险测试平台。在八个基准和多个模型主干中,Evo-PI 持续提高推理准确性,实现高达 24.6% 的增益。我们的结果表明,不断发展的原则指导监督为 MLLM 中专家一致推理的训练提供了可扩展的通用范式。代码可在 https://github.com/zhengxianda/Evo_PI 获取。
