论文
RAP:研究注意力预测揭示了目标条件证据获取偏差
RAP: Research Attention Prediction Reveals Target-Conditioned Evidence Acquisition Biases
摘要
大型语言模型(LLM)越来越多地充当研究智能体,但它们跟踪研究注意力变化的能力很难评估,因为评论和研究想法缺乏独特的可验证结果。我们引入研究注意力预测 (RAP),这是一个涵盖 278 个 AI/ML 领域和 1,390 个片段的滚动基准。在每次截止时,大语言模型智能体都会搜索暂时受限的 arXiv 语料库,并预测未来六个月八个冻结研究方向的论文份额。搜索通常会有所帮助,但所有四种诊断模型在成分准确性方面的表现都比精确计数指数加权移动平均 (EWMA) 基线差。我们确定了两个相互关联的瓶颈。在累积历史访问下,对于所有四种诊断模型,状态结转均优于直接预测;冻结证据重放将这种逆转的一个共同组成部分与检索较小份额的近期证据的预测导向政策联系起来。即使有确切的历史活动,针对未来的更新仍然有限,只有 GPT-5.5 加上重新开放的搜索稍微超过了 EWMA。对已实现结果的微调将 Qwen3-4B 的预测斯皮尔曼相关性提高了 0.105。