论文

MAWILE:检视LLM评价器的多轴工作台

MAWILE: Multi-Axis Workbench for Inspecting LLM Evaluators

模型评测评测方法与指标

摘要

大语言模型(LLM)裁判为评估模型与Agent输出提供了灵活且可扩展的方法,但其判定可能对被评回复、裁判指令与评分细则的偶然变化敏感。现有系统考察了这些失效模式的重要子集,但审计一个配置好的裁判需要同时测试裁判工具与其评估的对象。我们提出MAWILE,一个面向开发者的工作台,沿四个表面审计裁判敏感性:裁判提示、裁判细则、目标系统输入与目标系统输出。给定用户提供的裁判与代表性评估项,MAWILE构造并验证受控扰动、重新执行裁判并定位敏感性来源。每个扰动都声明判定应保持不变还是应向指定方向变化,使同一系统既能度量对无关变化的鲁棒性,又能度量对有意义变化的敏感性。MAWILE可审计二值、序数与成对裁判,且无需金标标签。工具代码见该网址。

MAWILE:检视LLM评价器的多轴工作台:论文配图
图 1:Mawile 端到端裁判审计工作流。给定一个已配置的裁判(judge)和有代表性的审计条目,规划器智能体生成一套可编辑的不变式与方向性探针。Mawile 随后生成并验证这些变体,将裁判与重复运行的未修改基线一同重新执行,并报告鲁棒性、退化敏感性,以及在有金标准标签时的正确性。