论文

WildSci:从真实文献推进科学推理

WildSci: Advancing Scientific Reasoning from In-the-Wild Literature

模型训练合成数据

摘要

近年来大语言模型(LLM)推理的进展集中于数学和代码等领域,这些领域拥有充足的高质量数据和客观的评测指标。相比之下,由于数据集覆盖有限以及开放式科学问题固有的复杂性,LLM推理模型在医学、材料科学等科学领域的进展仍然有限。为应对这些挑战,我们提出WildSci,一个从同行评审文献自动合成的领域特定科学问题新数据集,覆盖9个科学学科和26个子领域。通过将复杂的科学推理任务组织为选择题形式,我们实现了具有明确奖励信号的可扩展训练。我们进一步应用强化学习在这些数据上微调模型,并分析由此产生的训练动态,包括各领域的性能变化、回复行为和泛化趋势。在一系列科学基准上的实验证明了我们的数据集和方法的有效性。我们发布WildSci以支持可扩展、可持续的科学推理研究,获取地址为 https://huggingface.co/datasets/JustinTX/WildSci。

WildSci:从真实文献推进科学推理 配图
图 1:数据创建流水线概览。过滤基于启发式规则,而精炼则扩展选项空间并改写问题以增加多样性。