论文

Litmus:评估AI系统的零标注、代码驱动指标规约

Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems

模型评测评测方法与指标

摘要

随智能体LLM系统从原型走向跨日益多样领域的部署——评估它们变得更重要也更困难。挑战不仅是个别指标可能不可靠——还有评估目标常被留在隐式状态。没有对系统应做什么、如何失败、哪些失败要紧的清晰说明——指标选择就难以正当化、解释或验证。我们提出Litmus——零标注系统:经从源代码与定向询问引出评估意图——为AI管线设计与评估及监控指标。Litmus不假设评估目标已知——而是先识别必须度量什么与为什么——再把答案转为构建有正当性的分阶段指标组合的约束。我们在三个真实、代码定义的AI管线——财务账户分组、科学问答与固有风险评估——上对照AutoMetrics与三个DynamicRubric基线评估Litmus。Litmus取得最广或并列最广的关注点覆盖、横跨更多管线阶段、产出近零冗余组合——并在全部三个管线上对照逐行质量标签的有效性排名第一——在科学问答上果断领先(Spearman ρ=0.72,对每个基线低于0.47)——在审计框架两个组件上处于重叠置信区间——而指标设计期间未使用任何标签。我们的结果支持从自动指标实现转向自动指标规约:在问计算哪个指标之前——评估系统应问必须度量什么与为什么。

Litmus:评估AI系统的零标注、代码驱动指标规约:论文配图
图 1:Litmus 通过首先提出问题来设计指标。仅从源代码和从业者的目标出发,它通过面向从业者的澄清问题和内部对抗性有效性问题来询问管道。答案成为充当约束的事实,产生合理的、每阶段的度量组合。