论文
编码代理可以复制官方统计数据吗?受控欧盟统计局基准中的元数据、重试预算和执行反馈的限制
Can Coding Agents Reproduce Official Statistics? Metadata, Retry Budget and the Limits of Execution Feedback in a Controlled Eurostat Benchmark
摘要
大型语言模型可以生成可执行的数据分析代码,但成功执行并不等于有效的官方统计结果。本研究询问权威元数据和执行反馈是否提高了编码代理生成的欧盟统计局答案的可重复性,并隔离了执行反馈的实际贡献。涵盖七个领域、七个欧盟统计局数据集和四个难度等级的 30 个自然语言任务的基准测试在四种条件下运行:仅任务 (A)、任务加上冻结数据集元数据卡 (B)、元数据加上由经过净化的执行反馈驱动的修复循环 (C)、元数据加上没有任何类型诊断的相同尝试预算 (D)。 Claude Sonnet 5 通过 Anthropic Messages API 在三个独立的重复中生成了 Python,产生了 360 个任务运行。精确的正确性需要成功执行、正确的数据集、过滤器、输出形状、值和单位。在未指定的输出合约下运行的配套实验,其中从未向模型说明所需的排名键和单位表示,将条件 C 低估了 23.4 个点,表明评估者和合约设计可以主导测量的代理误差。可靠的统计编码代理需要针对冻结规范、完全指定的输出契约和重试预算进行语义验证,而不是执行诊断。