论文

ATLAS:跨尺度长情境能力全方位测试

ATLAS: All-round Testing of Long-context Abilities across Scales

模型评测评测方法与指标

摘要

长上下文语言模型现在广告的上下文窗口高达数百万个标记,但评估通常报告单个长度或狭窄的任务族,掩盖了两种故障模式:随着长度的增长,性能可能会崩溃,并且强大的检索不需要转移到下游使用。我们提出了 ATLAS,一个基准测试框架,它将长上下文评估重新定义为长度相关的能力分析。 ATLAS 贡献了三个方法论原则:(i) 将基础操作与应用程序工作负载分开的分层分类法,以便对故障进行归因;(ii) 长度感知 AUC 评分,在固定 8K-1M 网格上集成分数长度曲线,用完整的退化曲线取代单点指标;(iii) ATLAScore,分类法类别的调和平均聚合,惩罚不平衡的曲线,通过从子集分数到非线性最终聚合的端到端不确定性传播。我们使用 9 个可审计组件和 6,438 个实例跨 8 个功能维度实例化该框架,并评估 26 个模型。 Gemini-3.1-Pro-Preview 以 128K 领先,Claude-Opus-4.6 以 1M 领先。 ATLASscore@8K-128K 和 ATLASscore@8K-1M 之间的排名大幅洗牌:7 个模型至少移动了两个排名,两个分类层仅共享 61% 的跨模型方差,个体排名差距高达 12 个位置。这些结果支持通过能力和长度而不是单个标题分数来报告长上下文质量。