论文
过滤推理分数:评估模型最置信轨迹的推理质量
Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces
摘要
我们应该相信 大语言模型 (LLM) 的高精度吗? LLM 在推理基准上实现了高精度,但仅正确性并不能揭示用于产生它的推理的质量。这凸显了基于结果的评估的一个根本局限性:模型可能通过有缺陷的推理得出正确的答案,而具有显着不同推理能力的模型仍然可以表现出相似的基准准确性,例如由于记忆或过度优化。在本文中,我们问:鉴于现有基准,我们是否可以超越基于结果的评估来评估推理本身的质量?我们寻求的指标能够(1)以相似的精度区分模型,(2)对输入提示和生成配置的变化具有鲁棒性。为此,我们提出了一个推理分数,沿着 忠实性、连贯性、实用性和事实性等维度评估推理轨迹。剩下的问题是如何在多个采样轨迹上汇总这个分数。天真地对它们进行平均是不可取的,特别是在长视野设置中,其中可能的轨迹数量迅速增长,并且低置信度的正确轨迹更有可能是巧合。为了解决这个问题,我们引入了过滤推理分数 (FRS),它仅使用前 K% 最置信的迹线来计算推理质量。通过 FRS 进行评估,在标准精度下无法区分的模型在推理质量上表现出显着差异。此外,在一个基准上具有较高 FRS 的模型往往在其他推理基准上表现更好,无论是在准确性还是推理质量上。总之,这些发现表明 FRS 通过捕获模型的可转移推理能力来补充准确性。我们开源了我们的评估代码库:https://github.com/Manas2006/benchmark_reproducibility。