论文

经PredicateLongBench理解长上下文任务的困难轴

Understanding Axes of Difficulty For Long Context Tasks Via PredicateLongBench

模型评测基准与评测资源

摘要

大语言模型(LLM)展示了快速改善的长上下文能力,催生了旨在评估它们的基准浪潮。但既有长上下文评估——从大海捞针(NIAH)测试到近期的多跳推理与摘要任务——主要测量平均情况表现,且许多已饱和或缺乏鲁棒性。显著缺席的是系统性地探查模型在沿各种轴放大任务难度时如何表现的方法。我们以PredicateLongBench弥合该差距:基准通过要求模型识别长输入中满足给定谓词/约束(如词典序)的最长连续词子序列来压力测试长上下文推理——谓词取自更广的谓词类。基准的核心创新是识别并系统探索多个不同的困难轴——检验长上下文理解的多个方面。我们提供两条互补的生成管线:使用随机类词字符串的全合成设定,与从自然文档采样单词同时保持其分布性质的真实设定。我们发现:当我们沿各轴放大任务难度时,前沿模型难以表现良好——演示了该基准在理解当前长上下文能力局限上的效用。此外PredicateLongBench中的任务虽有挑战但概念简单——不需要基于LLM的生成或裁判。