论文

InternReviewer与InternAdvocate:同行评审和答辩中智能体强化学习的客观奖励与评估

InternReviewer & InternAdvocate: Objective Reward and Evaluation for Agentic Reinforcement Learning in Peer Review and Rebuttal

模型训练强化学习Agentic RL

摘要

生成专业学术内容,例如同行评审和反驳,需要领域推理和事实基础之间错综复杂的协同作用。这项工作为专业学术代理、实习审稿人和实习倡导者的开发和评估提供了一个全面的框架。我们首先建立大规模、高质量的学术数据集,并集成高效的 arXiv 检索工具以实现主动证据收集。为了优化这些代理,我们实施了由统一的目标指标和奖励系统驱动的代理强化学习(RL)范式。该系统通过采用多维标准,包括参考锚定的语义对齐、结构合规性以及根据实时交互日志交叉检查引文以消除幻觉的严格验证机制,避免了基于主观模型的判断的偏差。实验结果表明,在这个闭环框架内训练的智能体在推理深度和引用准确性方面表现出显着的提高。

InternReviewer与InternAdvocate:同行评审和答辩中智能体强化学习的客观奖励与评估:论文配图
图1:供同行审查和反驳轨道使用的数据分析。