论文

下限、上限和融合差距:机器可以预测多少人群阅读注意力?

Floor, Ceiling, and the Fusion Gap: How Much of Crowd Reading Attention Can Machines Predict?

模型评测模型能力评测

摘要

如果不知道一个简单的方法能实现什么以及最好的方法可以实现什么,那么基准分数就毫无意义。我们用一种罕见的 真值 构建了一个任务的两个边界:预测一群读者在 120 个网络文档中标记了哪些句子 - 出于他们自己的目的而突出显示,无报酬、无指导且彼此不知情。地板是天真的截断(铅);天花板是一个分半的预言:一半的人群预测另一半。它们之间的差距是+0.2028 AP [+0.1698,+0.2342,域集群],三个发现构成了它。首先,差距是语义上的:位置和长度特征恢复了 5%。其次,前沿语言模型达到了 35-53% 的零样本——远高于经典基线,远低于人群;最先进的提示压缩器 (LLMLingua-2) 位于地板下方,与随机选择没有区别。第三,五个前沿排名加上一个先验排名的未加权跨供应商融合达到 60%,以 +0.0159 击败最佳单一模型 [+0.0044,+0.0269; Holm p=0.019]——在消除其最佳成员、分半臂选择、提示释义以及标签、门和种子扰动后仍然存在的增益,并通过 217 个独立文档的预注册复制得到确认(+0.0179,Holm p=0.042)。最后,括号压缩:将融合提炼为一个开放权重 8B 学生,该学生读取整个文档保留了 90% 的融合边缘,并与最强的单一前沿模型 (+0.0070 [-0.0068, +0.0200]) 达到统计同等性,其中本地上下文学生仅保留了 63%——人群的信号存在于文档级结构中,而已知的最便宜的改进是询问几个不同的模型和平均。