论文
清晰的直觉还是真实的分析? LLM-as-a-Judge 同行评审中的认知可靠性基准测试
Articulate Intuition or Genuine Analysis? Benchmarking Epistemic Reliability in LLM-as-a-Judge Peer Reviews
摘要
当 LLM 法官称同行评审为分析性,而人类委员会称另一次评审为高质量时,他们是否跟踪同一件事?我们认为它们不是,而且这种差异在哲学上很重要。我们将 Kahneman 的双过程理论运用到同行评审的结构化标题中,并发布了 Kahneman4Review,这是一个包含 3,563 条评级评论的基准,根据 9 个理论驱动的文本维度、8 个偏差诊断和一个连续推理质量评分进行评分。三项发现与可信度有关:决策层与标题的基于文本的认知质量代理没有明显一致;公开展示的代理评论比汇总的人类评论获得更高的原始分数,但长度和地点解释了大部分差距,并且样本不是纸质配对的; ICLR 审阅文本诊断在 2022--2023 年过渡期间发生转变,时间上与广泛的 LLM 可用性一致,但未确定其原因。匹配的功能探针试点进一步表明,该标题区分了文本探针,旨在将真正的故障查找与表面流畅性进行对比。我们认为,LLM 法官值得信赖的可靠性基准必须将分析形式与认知功能分开,并针对该目标提出具体的设计选择。交互式演示位于 https://huggingface.co/spaces/nuojohnchen/Kahneman4Review。