论文

CrossTrace:用于假设生成的有根据的科学推理轨迹的跨域数据集

CrossTrace: A Cross-Domain Dataset of Grounded Scientific Reasoning Traces for Hypothesis Generation

模型训练合成数据

摘要

科学假设生成是加速研究的关键瓶颈,但用于训练和评估假设生成模型的现有数据集仅限于单个领域,并且缺乏将先验知识与新贡献联系起来的明确推理轨迹。我介绍 CrossTrace,这是一个包含 1,389 条科学推理轨迹的数据集,涵盖生物医学研究 (518)、AI/ML (605) 和跨领域工作 (266)。每条痕迹都捕获了从已建立的知识到中间逻辑步骤到新假设的结构化推理链,每一步都以源论文文本为基础。我定义了一个输入/跟踪/输出模式,该模式通过步骤级验证、八种发现模式的分类法和多域覆盖来扩展 HypoGen 的 Bit-Flip-Spark 框架。 微调 Qwen2.5-7B-通过 QLoRA 对 CrossTrace 进行指导,与未调整的基线相比产生了实质性改进:IAScore 从 0.828 上升到 0.968(GPT-4o 判断),从 0.716 上升到 0.888(Claude Opus 4.5),结构合规性从 0% 提高到 100%,火花余弦相似度从0.221 至 0.620。平衡的跨领域训练(生物医学+人工智能/机器学习+计算机科学)优于单领域训练,为科学推理模式跨学科转移提供了证据。对 150 条分层记录的人工验证证实了 99.7% 的步骤级证据依据准确率和 0.0% 的编造率。据我所知,CrossTrace 是第一个大规模跨域数据集,具有用于假设生成的步骤级有来源依据的推理轨迹,我的结果表明,此类轨迹是有效的训练信号,其好处至少部分是领域通用的。