论文

提问而非打分:面向可解释LLM评估与自我改进的二元问题

Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement

模型评测评测方法与指标

摘要

评估LLM输出仍是NLP的主要瓶颈:人类评估昂贵缓慢——词汇指标与开放式生成的人类判断相关差——整体式LLM裁判常产出难以调试的不透明分数。我们提出BINEVAL——框架:把评估标准分解为原子二元问题——并把所得裁决聚合为可解释、多维分数。给定任务提示——元提示生成细粒度评估问题——LLM对每个输出独立回答——产出透明的问题级反馈与经校准的总体分。该分解使评估更易检查、更易诊断——并可直接用于提示改进。跨SummEval、Topical-Chat与QAGS——BINEVAL匹敌或超越UniEval与G-Eval等强基线——在QAGS等事实一致性基准上结果尤强。除与人类判断有竞争力的相关外——BINEVAL更好匹配人类分数分布——避免先前LLM裁判常见的天花板效应——对边缘与明显有缺陷输出的区分更好。我们进一步表明同一问题级反馈支持迭代提示优化——在自更新与跨模型更新设定下改进摘要的评估器提示与IFBench上的生成提示。总体而言——BINEVAL提供任务无关、免训练、可解释的评估框架——结合强实证表现与实用诊断及优化价值。

提问而非打分:面向可解释LLM评估与自我改进的二元问题:论文配图
图 3:每个 SummEval 维度内的成对 phi 系数相关矩阵。低非对角线值表明问题捕获了维度的不同方面。所有维度上的平均非对角线 phi\phi 为 0.380.38。有关问题定义,请参阅附录 E。