论文

提示框架扭曲了基于计数的 LLM 错误检测评估:来自数字锚定的证据

Prompt Framing Distorts Count Based Evaluation of LLM Error Detection: Evidence from Numeric Anchoring

模型评测评测方法与指标

摘要

基于计数的 F1 被广泛用作 LLM 错误检测质量的代理,但本文表明,如果跨度定位没有相应改进,它可能会急剧上升,这一差距称为 F1 膨胀。本文介绍了 ErrorBench,这是一种用于提示引起的计数失真的受控压力测试协议。 ErrorBench 在五种提示条件下对来自 143 CoNLL-2014 段落的 4,290 个响应评估了 6 个当代 LLM。在 CoNLL-2014 M2 式评分下,锚定提示产生高达 0.79 分的 F1 通货膨胀点,在严格匹配下高达 0.96 点。使用官方 ERRANT 3.0.0 管道和多参考评分进行 100 段复制,重现了该模式:平均超过 6 个模型,盲锚定提示转变将 Count-F1 提高了 +0.21,而多参考 ERRANT F0.5 仅提高了 +0.04。研究发现,在这种压力测试协议下,高度符合指令的 GPT/Claude 系统中的计数反应较大,而 Gemini 系列中的反应较小。研究结果表明,LLM 校对和文档审查评估应避免预先填充的错误计数,并应报告跨度感知指标以及基于计数的指标。