论文

大语言模型 的潜在性能分析

Latent Performance Profiling of Large Language Models

模型评测评测方法与指标

摘要

大语言模型 (LLM) 经常在标准化基准测试中取得令人印象深刻的分数,但仅凭准确性来衡量其能力是有限的。通过排行榜评估开源 LLM 面临着数据污染、任务范围狭窄以及与现实世界可靠性的一致性差等持续存在的问题。基于基准的评估(例如 MMLU PRO、BBH 或 IFEval)主要捕获模型在固定测试集​​上的输出,而不是它如何处理信息、校准不确定性或构建内部知识。在本文中,我们主张从以基准为中心的评估转向对 LLM 进行补充、以状态为中心的内在评估。为此,我们引入了潜在性能分析(LPP)——一个从隐藏激活和输出分布中导出与任务无关的诊断的框架。 LPP 定义了一组关于模型的潜在表示和动态的标量指标,揭示了与尺度无关的特征,从而实现可解释的比较并发现隐藏的漏洞。与静态准确度分数不同,LPP 在相似大小的模型中提供稳定的、架构敏感的签名。通过对八个 LLM(大小范围为 0.5B-14B)的广泛实证分析,我们证明具有相似基准分数的模型可以表现出对比鲜明的潜在特征,例如熵或适应性的差异。在这些见解的指导下,我们设计了针对不确定性和符号推理的综合探针,这些探针与内在指标相一致,同时与排行榜偏见脱钩。我们建议将 LPP 与基准一起报告可以对模型行为有更深入、可解释的理解,从而实现更可靠的模型选择、安全评估和超越表面精度的评估。