论文
是时候反思一下了:我们可以相信 LLM 法官的循证研究代理吗?
Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?
摘要
深度研究代理日益自动化复杂的信息搜寻任务,通过多步骤推理、工具使用和综合生成基于证据的报告。他们不断增长的角色需要可扩展、可靠的评估,将 LLM 作为法官定位为评估事实准确性、证据使用和推理质量的监督范式。然而,这些法官对深度研究代理的可靠性仍然知之甚少,这就提出了一个关键的元评估问题:在部署 LLM 法官来监督研究代理之前,我们必须首先评估法官本身。现有的元评估在两个方面存在缺陷:(1)依赖粗略的、主观的人类偏好一致性; (2) 专注于遵循指令或可验证的任务,不探索开放式代理执行。为了解决这些差距,我们引入了 REFLECT(通过受控干预进行可靠的细粒度 LLM 判断评估),这是一种针对代理环境中细粒度故障检测的元评估基准。 REFLECT 定义了过程和结果级别故障模式的详细分类,通过对经过质量筛选的代理执行轨迹执行受控和本地化干预来实例化。这会产生可验证的、全面的、细粒度的实例来验证判断模型。我们的实验表明,当前的 LLM 判断仍然不可靠:即使是性能最好的模型,在推理、工具使用和报告质量失败方面的总体准确率也低于 55%,尤其是在证据验证方面的表现尤其差。总之,我们的分类法和研究结果揭示了系统性判断的局限性,揭示了成本和可靠性的权衡,并为深度研究代理构建更可靠的评估管道提供了可行的指导。