论文
图原生强化学习经概念重组实现可追踪的科学假说生成
Graph-Native Reinforcement Learning Enables Traceable Scientific Hypothesis Generation through Conceptual Recombination
摘要
加速材料发现需要AI系统通过多步领域落地推理生成科学有效的假说。标准LLM对开放式材料设计问题常产生流畅但可追踪性弱的响应——难以确定最终答案是否由连贯的中间推理支撑。我们开发Graph-PRefLexOR:经GRPO微调的图原生推理模型族——将推理组织为机制探索、图构建、模式提取与假说合成的显式阶段。该设计将神经语言生成与符号关系结构链接——使因果连接可被构建、检查与复用。在材料科学与力学文献的100个开放式问题上:Graph-PRefLexOR较对应基座模型提升40–65%,推理可追踪性增益最大。嵌入分析显示更广的语义探索与约2–3倍于基线的语义多样性。语义回溯与逐层隐状态分析进一步显示结构化推理与最终答案之间更强的对齐。最后,测试时图扩展揭示额外算力主要增加有界语义空间内的长程概念重组——而非简单扩大语义覆盖。
