论文

密集上下文是硬上下文:词汇密度限制 LLM 中的有效上下文

Dense Contexts Are Hard Contexts: Lexical Density Limits Effective Context in LLMs

模型评测模型能力评测

摘要

输入长度和相关信息的位置被广泛认为是 LLM 长上下文性能下降的主要原因。在这里,我们研究词汇密度——上下文引入不同信息的速率——作为第三个很大程度上被忽视的因素,它系统地减少了 LLM 的有效上下文窗口。我们使用三个具有相同长度(~12k 标记)和受控针位置但增加信息密度的“find-the-needle”风格基准来量化词汇密度对开放权重 LLM (9B-685B) 的影响。我们观察到高密度基准测试中的性能急剧下降:在稀疏环境中近乎完美的模型在密集环境中的检索得分下降到 60% 以下。为了排除任务类型的混淆,我们改变并控制每个基准中的密度,同时保持所有其他属性不变。降低密度通常可以恢复性能,特别是在出现退化的高密度区域。这些结果表明,有效上下文容量是词汇密度的函数,对在紧凑、信息丰富的输入上运行的现实世界 LLM 系统有直接影响。