论文
SA-Bench:评测基于LLM的论文复现中的语义对齐
SA-Bench: Evaluating Semantic Alignment in LLM-Based Paper Reproduction
摘要
LLM智能体可以生成论文复现代码,但常常产出科学上不忠实的实现。我们将这种失败模式定义为语义漂移:生成的代码悄悄偏离论文的规格说明。我们提出SemanticAlign-Bench(SA-Bench),一个诊断性基准,覆盖ICLR、ICML和NeurIPS 2025的30篇论文。对每篇论文,我们将其规格分解为原子且可验证的实现声明,称为语义对齐单元(SAU),并沿数值、方法、协议和顺序漂移四个诊断维度评估代码仓库。我们共构建了横跨五个机器学习领域的1,491个SAU,并评测12种生成配置(4个模型×3种脚手架)。即使最强的配置(Claude+PaperCoder),其平均SAU得分也仅为1.0分中的0.301,360次评测的总体均值为0.221。失败分类法显示,智能体尝试了大多数要求但实现不正确,实现不匹配和空桩(stub)占零分声明的大多数。我们的分析进一步表明,为可执行性优化的脚手架对科学复现的助益有限;缩小差距需要优先进行语义规格验证的脚手架。基准、标注与评测流程已公开。
