论文
Mubric:用于 LLM 评估的突变测试引导的标题生成
Mubric: Mutation Testing-Guided Rubric Generation for LLM Evaluation
摘要
基于评分标准的评估广泛用于通过将响应质量分解为特定于任务的评分标准来评估基于 LLM 的系统。然而,自动生成可靠地捕获特定于任务的质量要求的标准仍然具有挑战性。我们引入 Mubric,一种突变测试引导的标题生成方法。突变测试是一种经典的软件测试方法,通过将错误注入程序并检查测试是否检测到它们来评估测试套件。我们在测试套件和评分标准之间进行类比:如果评分标准捕获了重要的质量要求,则将相应的缺陷引入到其他高质量的响应中应该会降低其分数。 Mubric 首先从真实的首选和非首选响应对中挖掘常见缺陷,并将这些缺陷抽象为可重用的变异算子,每个算子指定如何引入特定类型的响应缺陷。对于新任务,它将相关运算符应用于参考响应,检查注入的缺陷是否会降低响应质量,并使用未充分惩罚的缺陷来细化标题。我们根据六种先进的评分标准生成方法,在四个代表性领域的 703 项任务上对 Mubric 进行了评估。 Mubric 实现了最高的总体评估准确度,比最强基线高出 7.48 个百分点。