论文
Sci-CoE:以几何共识在稀疏监督下协同演化科学推理LLM
Sci-CoE: Co-evolving Scientific Reasoning LLMs via Geometric Consensus with Sparse Supervision
摘要
大型语言模型(LLM)已展现出卓越的推理能力,协同演化范式在代码和数学等领域已显示出可喜成果。然而,在科学推理任务中,这些模型仍然脆弱,原因在于解法评估不可靠以及验证策略多样性有限。在这项工作中,我们提出Sci-CoE,一个两阶段科学协同演化框架,使模型通过从稀疏监督到无监督学习的过渡,能够作为求解者和验证者自我演化。在第一阶段,模型使用少量标注数据为验证者(Verifier)建立基本的正确性判断锚点。在第二阶段,我们引入一个联合考虑共识、可靠性和多样性的几何奖励机制,推动在无标注数据上进行大规模自迭代。在多个通用科学基准上的实验表明,Sci-CoE增强了复杂推理能力并展现出强可扩展性,有助于构建更稳健、更多样的评估体系。代码见 https://github.com/InternScience/Sci-CoE 。
