论文
SciFigure2Code:人工智能重构的科学图形到代码基准
SciFigure2Code: An AI-Reconstructed Benchmark for Scientific Figure-to-Code
摘要
科学数据是检查和重复使用研究主张的界面,但最终发布的面板很少公开产生它们的数据或绘图代码。因此,从像素中恢复这种隐藏的来源还不确定。我们引入了 SciFigure2Code,这是一个人工智能重建的基准测试,它评估演示恢复:生成可编辑的 Python 程序,保留科学面板的排列和读取方式。专门角色的 Codex 代理生成、执行、视觉优化和审核银标准演示程序,这些程序捕获几何、视觉层次结构、编码、注释和排版,而无需声称恢复原始测量或作者源代码。这种重建和审核协议将最终发布的面板转变为可审核的参考包;生成的资源包含 6,740 个经过审查的面板和 SciFigureBench,这是一个平衡的 337 个面板测试集,涵盖 31 个图表子类型、五个领域和三个复杂级别。在仅图像和字幕辅助设置中的 14 个零样本模型中,执行、多组件布局、轴、图例和科学标签仍然很弱。 Claude Opus 4.7 获得了最高的仅图像总体得分,Claude Opus 4.6 领先于字幕辅助重建,两阶段计划然后编码提示提高了所有四个测试模型的总体得分。 SciFigure2Code 为构建可编辑、视觉上忠实的科学图形演示的代理提供了一个可审核的测试平台。