论文
学习并行代码的推理世界模型
Learning Reasoning World Models for Parallel Code
摘要
大语言模型 在串行代码生成方面表现出了卓越的能力,但在训练数据相对匮乏的并行代码方面仍然存在困难。常见的补救措施是使用与外部工具交互的 编码智能体,但工具调用可能成本高昂且有时不切实际,例如,对于部分编写的代码。我们提出并行代码世界模型(PCWM),推理 LLM,旨在直接从并行源代码预测工具结果。为了训练 PCWM,我们设计了一种新颖的探索和数据生成管道,该管道对跨多个领域的各种并行编码问题和候选实现进行采样,然后通过记录数据竞争和性能概况的工具执行它们。由此,我们综合推理轨迹,将源代码与观察到的工具结果因果联系起来。 微调 对所得数据产生了显着的增益,7B 参数世界模型在比赛结果预测中的准确度从 64.3% 提高到 72.8%,而 8B 参数模型在性能分析任务中的准确度从 49.3% 提高到 58.6%。此外,当开放权重模型负责修复数据竞赛时,相对于使用我们的 7B 参数世界模型的自我反馈,世界模型反馈将其竞赛修复率提高了 2.7%-9.1%,使用我们的 14B 参数世界模型提高了 6.1%-11.1%。我们的结果表明,推理世界模型可能有潜力与并行的外部工具调用一起使用 - 编码智能体。