论文

ErrorMap与ErrorAtlas:绘制大语言模型的失败版图

ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models

模型评测评测方法与指标

摘要

大语言模型(LLM)基准告诉我们模型何时失败,却不告诉我们为何失败。推理数据集上的错误答案可能源于格式问题、计算错误或数据集噪声,而非推理薄弱。不厘清这些原因,基准就是不完整的,无法可靠指导模型改进。我们提出 ErrorMap,首个绘制 LLM 失败来源的方法。它提取模型独特的失败签名,厘清基准究竟测什么,并拓宽错误识别以减少盲区。这帮助开发者调试模型,使基准目标与结果对齐,并支持有依据的模型选择。ErrorMap 以相同逻辑适用于任何模型或数据集。把方法应用于 35 个数据集与 83 个模型,我们生成 ErrorAtlas——一个模型错误分类体系,揭示反复出现的失败模式。ErrorAtlas 突出 LLM 研究中当前被探索不足的错误类型,例如输出遗漏必需细节与对问题的误解。通过把焦点从模型在哪里成功转向它们为何失败,ErrorMap 与 ErrorAtlas 实现更先进的评估——暴露隐藏弱点并指引进展。与通常以任务级指标衡量的成功不同,我们的方法引入更深的评估层,可全局应用于跨模型与跨任务,为模型行为与局限提供更丰富的洞见。我们公开分类体系与代码,并计划随新基准与模型出现定期更新 ErrorAtlas。

ErrorMap与ErrorAtlas:绘制大语言模型的失败版图
图1:ErrorMap 模式:两个方法阶段。第一阶段在实例层面对每个错误预测进行一次性分析。第二阶段基于最大分组深度或预设的层级阈值,通过递归迭代构建分层分类体系。