论文
GRAIN:通过不变性奖励的智能体强化学习弥合真实世界图推理中的名称与表述变化
GRAIN: Bridging Name and Narrative Shifts in Real-World Graph Reasoning through Invariance-Rewarded Agentic RL
摘要
尽管大语言模型(LLM)在标准化图任务上具有潜力,但它们在真实世界的节点标识符和任务表述变化面前仍然脆弱。确定性图工具对此类变化是不变的,但从含噪文本中抽取拓扑结构对LLM而言高度脆弱,它们往往过拟合于表面模式。此外,通过多智能体系统缓解这些解析失败会带来过高的时延。为解决这一问题,我们提出GRAIN,一个通过强化学习优化的单智能体框架。GRAIN将推理建模为语义解析与工具执行的流水线,并由结构不变性奖励(Structure Invariance Reward)引导。该奖励通过将抽取的中间图与真值拓扑进行验证,迫使LLM学习鲁棒的文本到结构映射,而非记忆语言伪迹。我们还引入GRIT,一个评估对此类语言变化敏感度的基准。GRAIN在准确率上超越多智能体基线16.45%,且时延约低24%。此外,它展现出更优的结构泛化能力,将SFT模型的分布外(OOD)差距减半(从15.77%降至7.80%),并在超出训练分布的大规模图上保持鲁棒性。
