论文

ReFigBench:将科学图形重建作为可编辑的 PowerPoint 工件进行基准测试

ReFigBench: Benchmarking Scientific Figure Reconstruction as Editable PowerPoint Artifacts

智能体系统Agent任务评测

摘要

多模式编码代理有望将视觉输入转化为可用的工件,并且它们通过模型周围的工具、工具层、上下文管理和执行环境进行操作。现有的评估通常会隔离简短的工具调用、API 跟踪或屏幕截图相似性,而在这些代理下的低分不能说明模型是否看到不佳、计划不佳或因利用而失败。我们研究科学概览图形重建,这是一项代理任务,其中源图像必须成为可编辑的 PowerPoint 幻灯片,并保留文本、拓扑、布局和本机文档结构。我们介绍 ReFigBench,这是一个基准和评估框架,基于从 arXiv 论文中检索的 1,000 个真实概览图,且具有完整出处。来自四个模型系列的编码代理在两个工作流程、直接代码生成和专门的 PPTX 工作流程下重建每个图形,最强大的模型在两个商业工具内运行,产生十种配置。评估结合了确定性工件检查、来自两个模型系列的评委的重复自动评分以及盲人比较。感知仍然是一个瓶颈,迭代渲染只能部分弥补。工作流程工作是否转化为质量取决于模型及其工具,因为同一模型从一个工具内的专门工作流程中获益,而在另一个工具内失去,并且即使在相同的直接提示下,工具也会改变分数。专门的工作流程消除了每种配置中的本机连接器,人类法官在大多数比赛中仍然更喜欢它的渲染,即使是最强大的代理也达不到标题上限。这些结果暴露了保真度和可编辑性之间的紧张关系,这是实际多模式文档代理面临的核心挑战。