论文

大语言模型 会仔细审查他们评论的内容吗?评分校准、错误检测和作者身份效应的多模式审核

Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects

模型评测模型能力评测

摘要

大语言模型 (LLM) 越来越多地用于生成同行评审,促使检查其批判性评估的能力。本研究评估了两个多模态 LLM、Qwen2.5-VL-72B 和 Pixtral-Large-124B,作为 2026 年国际学习表征会议(该会议发布了两个模型的训练截止日期)的 165 份提交材料的审稿人。手稿被呈现给两个模型,作者身份被蒙蔽,被高威望的联系所取代,或被低声望的联系所取代,并且以纯文本或文本与图形的格式。此外,在 55 篇手稿中插入了 145 个可验证的可检测错误,以评估自然和面向验证的提示下的错误识别。在所有稿件组中,包括被拒绝的投稿,LLM 分数范围为 7.0 至 8.1,而人类平均分数范围为 3.4 至 6.8。模型在自然提示下检测到了 12.1% 的已验证错误,而一句验证指令将检测率提高到了 22.2%;然而,78% 的错误仍未被发现。提供数字可以减少错误检测,同时提高评论分数。没有根据相应的图形可靠地验证视觉错误,并且一半的纯文本评论描述了未提供的图形。作者身份不会影响评论分数或错误检测。 LLM 编辑决策与简单分数平均产生的决策完全匹配。