论文
BioAlchemy:将生物学文献蒸馏为可用于推理的强化学习训练数据
BioAlchemy: Distilling Biological Literature into Reasoning-Ready Reinforcement Learning Training Data
摘要
尽管生物学训练文本语料庞大,推理模型对生物学研究的影响总体上落后于数学与编程领域。在本工作中,我们表明当前大规模推理数据集中的生物学问题与现代生物学研究主题分布并不吻合,这种主题失衡可能对性能产生负面影响。此外,我们发现从生物学研究文本中提取具有挑战性且可验证的研究问题的方法,是将强化学习应用于生物学研究任务以提升性能的一个关键却尚不成熟的环节。我们提出BioAlchemy,一个从生物学研究文本科学语料中获取多样化可验证问答对的流水线。我们构建了BioAlchemy-345K,一个包含超过34.5万个生物学科学推理问题的训练数据集。随后,我们展示了如何将数据集对齐到现代科学生物学的主题分布,并结合强化学习来提升推理性能。最后,我们提出BioAlchemist-8B,其在生物学基准上较基础推理模型提升9.12%。这些结果证明了我们的方法在发展更强生物学科学推理能力方面的有效性。BioAlchemist-8B模型已发布于:https://huggingface.co/BioAlchemy。