论文

BERT 作为法官:词法方法的稳健替代方案,用于基于参考的高效 LLM 评估

BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation

模型评测评测方法与指标

摘要

准确的评估是 大语言模型 (LLM) 生态系统的核心,指导不同用例的模型选择和下游采用。然而,在实践中,评估生成输出通常依赖于严格的词汇方法来提取和评估答案,这可能会将模型真正解决问题的能力与其对预定义格式指南的遵守情况混为一谈。虽然最近的 LLM-as-a-Judge 方法通过评估语义正确性而不是严格的结构一致性来缓解这个问题,但它们也引入了大量的计算开销,使得评估成本高昂。在这项工作中,我们首先通过涵盖 36 个模型和 15 个下游任务的大规模实证研究,系统地研究了词汇评估的局限性,证明此类方法与人类判断的相关性较差。为了解决这个限制,我们引入了 BERT-as-a-Judge,这是一种编码器驱动的方法,用于在基于参考的生成设置中评估答案的正确性,对输出短语的变化具有鲁棒性,并且只需要对综合注释的问题-候选-参考三元组进行轻量级训练。我们表明,它始终优于词汇基线,同时与更大的 LLM 判断器的性能相匹配,在两者之间提供了令人信服的权衡,并实现了可靠、可扩展的评估。最后,通过广泛的实验,我们提供了对 BERT-as-a-Judge 性能的详细见解,为从业者提供实用指导,并发布所有项目工件以促进下游采用。