论文
提问而非打分:面向可解释LLM评估与自我改进的二元问题
Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement
摘要
评估LLM输出仍是NLP的主要瓶颈:人类评估昂贵缓慢——词汇指标与开放式生成的人类判断相关差——整体式LLM裁判常产出难以调试的不透明分数。我们提出BINEVAL——框架:把评估标准分解为原子二元问题——并把所得裁决聚合为可解释、多维分数。给定任务提示——元提示生成细粒度评估问题——LLM对每个输出独立回答——产出透明的问题级反馈与经校准的总体分。该分解使评估更易检查、更易诊断——并可直接用于提示改进。跨SummEval、Topical-Chat与QAGS——BINEVAL匹敌或超越UniEval与G-Eval等强基线——在QAGS等事实一致性基准上结果尤强。除与人类判断有竞争力的相关外——BINEVAL更好匹配人类分数分布——避免先前LLM裁判常见的天花板效应——对边缘与明显有缺陷输出的区分更好。我们进一步表明同一问题级反馈支持迭代提示优化——在自更新与跨模型更新设定下改进摘要的评估器提示与IFBench上的生成提示。总体而言——BINEVAL提供任务无关、免训练、可解释的评估框架——结合强实证表现与实用诊断及优化价值。
