论文
MAWILE:检视LLM评价器的多轴工作台
MAWILE: Multi-Axis Workbench for Inspecting LLM Evaluators
摘要
大语言模型(LLM)裁判为评估模型与Agent输出提供了灵活且可扩展的方法,但其判定可能对被评回复、裁判指令与评分细则的偶然变化敏感。现有系统考察了这些失效模式的重要子集,但审计一个配置好的裁判需要同时测试裁判工具与其评估的对象。我们提出MAWILE,一个面向开发者的工作台,沿四个表面审计裁判敏感性:裁判提示、裁判细则、目标系统输入与目标系统输出。给定用户提供的裁判与代表性评估项,MAWILE构造并验证受控扰动、重新执行裁判并定位敏感性来源。每个扰动都声明判定应保持不变还是应向指定方向变化,使同一系统既能度量对无关变化的鲁棒性,又能度量对有意义变化的敏感性。MAWILE可审计二值、序数与成对裁判,且无需金标标签。工具代码见该网址。
