论文
Reconstruction:从发表前参考文献恢复研究构想的盲测基准
Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies
摘要
当只给定一篇已发表论文的发表前参考文献时,语言模型能否恢复该论文真正的研究构想?我们提出Reconstruction,一个盲式构想恢复基准:它隐去种子论文及所有同期或更晚的文献,要求模型提出假设,再由独立的大语言模型评判把假设与留出的真实构想匹配。协议包含严格的防泄漏设计——时间引用截止、匿名参考文献ID和逐论文冻结的参考文献——以防止种子构想在提示时泄漏。在六个科学领域的643篇受评论文上,七个前沿模型的Match率仅有约3-15%。随后我们评估一个仅用参考文献的多智能体(top 4)流水线,它把跨模型评审与基于对齐假设槽位的瑞士制循环赛相结合,不使用外部网络搜索。跨模型评审加循环赛选择把所有六个领域的Match率提升至约23-42%,相比最强单模型基线实现约2.4倍的观测提升。本稿以arXiv时间戳报告协议、防泄漏设计与当前结果。