论文

TADDLE:检测LLM生成同行评审缺陷的工具增强智能体

TADDLE: A Tool-Augmented Agent for Detecting Deficient LLM-Generated Peer Reviews

智能体系统Agent 工具调用

摘要

LLM生成的同行评审在主要会议上日益普遍,但其缺陷难以检测,因为它们普遍流畅且结构良好。现有工作要么只判别作者身份而不评判质量,要么使用为人类撰写的评审设计的特征来打分;此前没有系统能在具体缺陷类型层面检测LLM生成评审的缺陷。为填补这一空白,我们提出TADDLE——一个用于检测LLM生成同行评审缺陷的工具增强智能体,并一同发布了该任务的首个专家标注基准。该基准包含针对50篇ICLR 2025论文的1800条评审,由18位领域专家按照六类缺陷分类体系(外加一个无缺陷标签)进行多标签标注。TADDLE将检测分解为四个专用分析工具——Verify、Correct、Complete和Transform——由一个智能体编排;一个集成器通过两阶段半监督学习将它们的输出综合为二元与多标签分类。大量实验表明,TADDLE在二元检测和多标签分类任务上均表现强劲。我们在 https://github.com/AquariusAQ/TADDLE 发布基准与代码。

TADDLE:检测LLM生成同行评审缺陷的工具增强智能体:论文配图
图 1:数据集构建流程。论文被解析为四个文本组成部分;六个LLM根据九个角色生成评论; 1818 位领域专家对 1,8001{,}800 条评论的黄金标准子集进行多标签注释;两阶段半监督框架选择 2,7052{,}705 个高置信度角色一致的伪标记样本进行集成模块的第二阶段训练。