论文

IdeaAMBIG:基准测试实施-研究-想法规范中的关键差距

IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications

模型评测基准与评测资源

摘要

一个研究想法可能是新颖的、连贯的、科学上合理的,但其提出的方法可能仍然不够具体,无法忠实地实施。我们研究面向实施的研究方法规范的编纂准备情况,定义为它们是否为有能力的实施者或 编码智能体 提供足够的方法信息,以在没有不受支持的假设的情况下构建预期的方法。我们从论文、代码库、问题线程和复制工件中构建基于证据的规范及其支持的解决方案。我们引入了 IdeaAMBIG,这是一个包含 660 个基于证据的实例的基准:来自可重复性报告和 GitHub 问题的 163 个现实世界差距,以及注入到可编码参考文献中的 497 个受控合成差距。 IdeaAMBIG 评估三种功能:编码准备情况评估、缺陷定位和澄清操作生成。缺陷定位仅接收规范,而澄清另外接收带注释的缺陷。在 13 个 LLM 中,最佳模型在实际实例中实现了 9.6% 的宏观缺陷恢复率,但在给定缺陷时实现了 80.6% 的宏观澄清操作成功率。在一项预言机研究中,提供标准解决方案可将下游编码就绪率从 14% 提高到 98%。在所有评估的模型中,缺陷定位是主要瓶颈,鉴于缺陷,缺陷的澄清程度更高。