论文

图原生强化学习经概念重组实现可追踪的科学假说生成

Graph-Native Reinforcement Learning Enables Traceable Scientific Hypothesis Generation through Conceptual Recombination

模型训练强化学习

摘要

加速材料发现需要AI系统通过多步领域落地推理生成科学有效的假说。标准LLM对开放式材料设计问题常产生流畅但可追踪性弱的响应——难以确定最终答案是否由连贯的中间推理支撑。我们开发Graph-PRefLexOR:经GRPO微调的图原生推理模型族——将推理组织为机制探索、图构建、模式提取与假说合成的显式阶段。该设计将神经语言生成与符号关系结构链接——使因果连接可被构建、检查与复用。在材料科学与力学文献的100个开放式问题上:Graph-PRefLexOR较对应基座模型提升40–65%,推理可追踪性增益最大。嵌入分析显示更广的语义探索与约2–3倍于基线的语义多样性。语义回溯与逐层隐状态分析进一步显示结构化推理与最终答案之间更强的对齐。最后,测试时图扩展揭示额外算力主要增加有界语义空间内的长程概念重组——而非简单扩大语义覆盖。

图原生强化学习经概念重组实现可追踪的科学假说生成:论文配图
图 1:(a) 科学发现通常通过迭代假设生成、验证、重新构思和完善来进行。 (b) 大语言模型对科学问题的标准回答可能难以追踪,导致无法追踪、幻觉或矛盾。 (c) Graph-PRefLexOR 通过将 <think> 部分组织为显式推理阶段来解决此限制:<brainstorm> 用于机制探索,<graph> 用于关系草图,<graph_json> 用于规范图构造,<patterns> 用于因果主题提取,以及 <synthesis> 用于组装最终答案。