论文

MADE:超越通过多语言代理诊断引擎进行评分以获取细粒度的评估见解

MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights

模型评测评测方法与指标

摘要

多语言和多文化基准现在涵盖了数十种语言和模型族,但由此产生的分数景观仍然度量丰富而洞察力匮乏,因此需要细粒度的多语言后评估诊断。然而,单个 LLM 和开放式代理很容易被冗长、嘈杂的诊断输入所淹没,并且不存在可重用的分类法。为了解决这个问题,我们提出了 MADE,一种多语言代理诊断引擎,它将评估后分析分解为规划、聚合分析、实例级案例检查、多语言和文化反思以及有证据依据的报告生成。 MADE 与专家主导的 54 种查询和 15 种语言诊断集配对,在大规模多语言评估基础(33 个模型系列、11 个基准、26 种语言、34 种文化、866 万条评估记录)的基础上进行评估。实验表明,MADE 在诊断报告质量方面比最强的共享基线高出 47%,并且在 87.9% 的成对比较中受到人类多语言专家的青睐。 MADE 与多语言专家一起应用,进一步提出了关于部署、迭代和跨文化陷阱的四个可操作的发现,将基准分数表转化为模型选择和补救指南。