论文
AI生成评审用于训练后续评审模型,可能使判断趋同
When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation
摘要
大语言模型越来越多地作为自动评审或人类评审助手参与科研评价。模型生成的评审进入公开数据和后续训练语料后,AI同行评审可能形成递归反馈:后续模型学习前代模型的判断。本文在受控设置中研究其中一步,从Llama 3.1 8B出发,先用2018—2023年ICLR官方评审微调评审模型,再用2024年ICLR数据训练四个后续模型,系统调整官方与模型生成评审的混合比例。合成评审压缩了评分分布,并降低同一论文和整体语料层面的语义多样性,作者称之为“科研判断塌缩”。为缓解问题,开源系统TrustReviewer从两个阶段干预:训练时在筛选语料上单阶段训练核心评审模型,减少低质量和语义退化监督;测试时通过成对激活引导,进一步抑制残留的判断塌缩,无需额外训练或专家标注。结果刻画了递归评审训练的一项具体风险,并提供保持判断多样性、改善AI辅助科研评价推荐对齐的干预方式。