论文
以经验证的任务覆盖率评测LLM多重生成
Evaluating Multiple LLM Generations with Validated Task Coverage
摘要
许多LLM应用在提供多个候选输出供比较、验证或组合时才能发挥最大效用。然而,主流评测设定仍聚焦于单个输出,或将多个样本归约为单一成功或选定答案。这可能遗漏输出中是否包含多个真正不同的有用结果。我们提出VTC-Bench,一个面向该设定的五领域基准,并以经验证任务覆盖率(Validated Task Coverage, VTC)作为其核心评测量。该基准由精心挑选的真实数据任务构建,其输出质量与任务相关的独特性都可自动、可复现地检验,无需基于模型的裁判。VTC衡量在k次尝试中能获得多少个不同的有用结果。在多个模型和推理设定下,该基准得出了与传统评测不同的结论:从单次抽取质量看最强的配置未必是覆盖率最好的配置,而简单的输出多样性度量也无法可靠地恢复任务相关的覆盖率。这些结果表明,有限候选集可以被直接作为研究对象来评测,从而揭示出传统逐输出评测难以察觉的模型行为差异。