论文

TRN-R1-Zero:通过 LLM 仅使用强化学习进行文本丰富的网络推理

TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only

模型训练强化学习

摘要

富文本网络(TRN)上的零样本推理仍然是一个具有挑战性的前沿领域,因为模型必须将文本语义与关系结构集成在一起,而无需特定于任务的监督。虽然图神经网络依赖于固定的标签空间和监督目标,但最近基于 大语言模型 (LLM) 的方法经常忽略图上下文或依赖于较大模型的 蒸馏,从而限制了泛化。我们提出 TRN-R1-Zero,一个仅通过强化学习训练的 TRN 推理 后训练 框架。 TRN-R1-Zero 使用邻居感知组相对策略优化目标直接优化基础 LLM,该目标根据邻近信号信息量的新颖边际增益指标动态调整奖励,有效引导模型进行关系推理。与之前的方法不同,TRN-R1-Zero 不需要监督 微调 或大型推理模型生成的思想链数据。跨引用、超链接、社交和共同购买 TRN 基准的广泛实验证明了 TRN-R1-Zero 的优越性和稳健性。此外,严格依靠节点级训练,TRN-R1-Zero 实现了边缘和图级任务的零样本推理,超越了跨域传输。该代码库可在 https://github.com/superallen13/TRN-R1-Zero 上公开获取。