论文

AnE:通过 Anchor Evolution 推动多模态 LLM 的推理前沿

AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution

模型训练监督微调与指令调优

摘要

通过监督 微调 (SFT) 和强化学习 (RL) 实现的 后训练 对于增强多模态 大语言模型 (MLLM) 中的推理至关重要,但由于静态数据的限制,现有范例经常达到性能瓶颈。虽然当前的方法利用自我反思或自我进化来突破这些界限,但它们仍然遭受低质量合成数据引起的认知漂移和幻觉推理路径的困扰。为了应对这些挑战,我们提出了锚定进化(AnE),这是一种集成了真理锚定数据管理和模型进化的新范式,在推理前沿实现了忠实且稳定的性能增益。具体来说,我们提出了真相锚扩展,它通过轨迹轨迹采样来查明模型失败边界,并利用 真值 数据库来检索高保真锚以实现忠实的数据管理。随后,我们引入了支架剥离机制来内化推理能力。该机制首先通过脚手架增强监督来锚定推理路径,以减轻直接 SFT 在原始数据上的学习复杂性和分布漂移,然后利用 RL 剥离脚手架模板,从而有效地将推理路径转换为内在模型功能。多模态推理基准测试的实验结果表明,我们的方法大大提高了模型性能前沿,在八个多模态基准测试中将基础模型提高了 10.3%,并取得了最先进的结果。该代码将公开。