论文
REM-CTX:通过辅助上下文的强化学习进行自动同行评审
REM-CTX: Automated Peer Review via Reinforcement Learning with Auxiliary Context
摘要
大多数自动化同行评审系统仅依赖于文本手稿内容,而没有充分利用图形和外部学术信号等视觉元素。我们引入了 REM-CTX,这是一种强化学习系统,它通过对应感知奖励函数将辅助上下文纳入评论生成过程。 REM-CTX 使用组相对策略优化 (GRPO) 训练 8B 参数语言模型,并将多方面质量奖励与明确鼓励与辅助上下文保持一致的两个对应奖励相结合。对计算机、生物和物理科学领域的手稿进行的实验表明,REM-CTX 在六个基线中实现了最高的总体审查质量,优于具有更大商业模型的其他系统,并且在质量和上下文基础指标方面都超过了次优 RL 基线。消融研究证实,这两种对应奖励是互补的:每个都有选择性地提高其目标对应奖励,同时保留所有质量维度,并且完整模型优于所有部分变体。对训练动态的分析表明,批评方面与训练期间的其他指标呈负相关,这表明未来的研究应该对评论生成进行多维度奖励分组。