论文

测量与读取器的对齐突出显示位置和长度的净值

Measuring Alignment With Reader Highlights Net of Position and Length

模型评测评测方法与指标

摘要

上下文压缩会在语言模型读取文档之前丢弃文档的大部分内容,并且通常通过下游任务的准确性进行评估 - 这使得另一个模型可以判断重要的内容。自然主义的社交突出显示提供了非循环参考:许多人在同一页面上独立标记段落。但是,明显的指标,即压缩器保留的人群标记句子的比例,被混淆了两次:人群标记是前置的,而人群标记的句子更长,因此任何有利于早期或长句子的方法都会得分很高,无论读者如何。我们通过将每个标记的句子与同一文档的未标记句子以相等的相对深度和相等的文档内长度排名进行匹配来删除这两个句子,并且我们校准仅根据位置和长度构建的合成空值的每个估计器 - 这一步很重要,因为仅深度分层会在 20-36% 的空值上返回假阳性,而这些空值不包含任何效果。在 120 个网络文档(每个文档至少有 12 个独立读者)上,语言模型重要性排名将 38.4% 的人群标记句子与 19.9% 的匹配邻居保持一致:在完全随机化测试下,在不考虑聚类和跨供应商复制的情况下,p = 0.0005,富集 +0.196 [+0.148, +0.239]。朴素截断(其保留规则是位置)正确地下降到 +0.003。为了给这个数字一个尺度:在相同的预算下,针对重新计算以排除它们的人群标签,得分相同,单个人类读者达到 +0.182 - 与 GPT-5.4 (+0.002 [-0.081, +0.088]) 无法区分,并且低于 Claude Opus 5。经典方法不是空的 - Luhn 1958 启发式达到 +0.088 - 因此读者选择在一定程度上是有效的可通过计算字数来恢复;另外对词汇中心性的调节仅消除了 0.010,因此一致性不是中心性。我们还报告说,我们之前的工作中的主张并未在该语料库上重现。