论文

超越静态排行榜:用预测效度评估大语言模型智能体

Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents

模型评测评测方法与指标

摘要

智能体基准快速增长——但没有单一基准触及部署暴露维度中的四五个以上。本文聚合迄今针对某一基于MCP的工业智能体基准最大规模的协同深潜:十四项并行实现研究——覆盖新资产类别(含多模态视觉扩展)、替代编排、检索策略、推理模式、基础设施优化与评估方法学探针。把这些研究与七个先前智能体基准整合——我们论证聚合分数排行榜系统性欠指定部署智能体评估。由聚合分数导出的排名不迁移到分布外设定;近期公开对隐藏竞赛的复盘提供了这种排名不稳定性的直接实证证据。我们提议按预测效度(样本内与样本外排名的相关)而非样本内均值对配置排名——并报告十二层测量装置——暴露HELM及其智能体时代后继者所坍缩的部署相关维度。该立场经三个带显式阈值的可证伪分布外准则操作化;既有证据部分支持但太薄不足以确认。我们以预注册试点设计与下一代智能体基准应报告什么的领域级愿景作结。