论文

风险不是评审价值:有限评审预算下的错误答案暴露

Risk Is Not Review Value: Wrong-Answer Exposure Under Bounded Review Budgets

模型评测评测方法与指标

摘要

在用户看到之前,大语言模型助理通常会产生比人类可以查看的答案更多的答案。大多数评估都会询问答案是否错误、不受支持或可信度低。相反,有限的审核预算会询问在固定审核预算下应首先检查哪些答案。仅有风险是不够的:高风险的答案可能难以修复,而中等风险的答案可能可以根据现有证据直接纠正。对于生成答案评估,我们将评论优先级建模为减少曝光,其中评论价值结合了估计的错误、干预可供性、影响和成本。我们使用错误答案暴露率(WAER)(未审核的错误答案的比例)和修复后残留暴露率(PRRE)(确定性基准支持的修复后仍然暴露的比例)来评估审核队列。 PRRE 使用的可修复性规则不会在数字上重用用于排名的可供性分数。在 720 项 TAT-QA/SciFact 压力基准上,评论值排名使答案级别 WAER 几乎保持在 20% 预算不变(0.605 与 0.600),但将 PRRE 从 0.881 降低到 0.716。这些结果表明,值得信赖的大语言模型评估不仅应该衡量错误检测,还应该衡量有限的审查能力如何减少暴露的错误答案。