论文
SciWalker:用算子图与执行反馈合成科学编程问题
SciWalker: Synthesizing Scientific Coding Problems with Operator Graphs and Execution Feedback
摘要
提升大语言模型(LLM)的科学编程能力需要高质量训练数据,但这类数据仍然稀缺:人工编写贴近真实的问题成本高、耗时长,而系统性地覆盖多样的科学领域与算法组合也颇具挑战。为此,我们提出SciWalker,一个通过算子链采样与执行反馈来合成科学编程问题的框架。该框架将科学库接口与操作模式结合以实例化算子,把算子组织成算子图,并采样算子链作为计算工作流线索。在这些线索的引导下,我们采用LLM生成有科学依据的问题描述、参考解答和测试,失败的生成结果则借助执行反馈迭代修复。通过将结构化工作流组合与验证及质量审查相结合,SciWalker在实现可扩展任务生成的同时,保证了科学依据、计算多样性和可执行性。利用该框架,我们构建了覆盖5个科学领域、32个子领域的8,178个高质量问题。为评估其训练价值,我们使用GSPO算法在Qwen3.5-9B上进行强化学习,将SciCode子问题准确率提升9.9个百分点(从29.3%到39.2%),并在科学代码生成、代码修复和推理基准上均有增益。SciWalker的代码已开源。
