论文

DrawAI:使光栅图像可编辑的代理基准和工作流程

DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable

智能体系统Agent任务评测

摘要

最近的图像生成模型和多模式代理可以为日益复杂的视觉通信任务生成高质量的视觉效果。然而,它们的栅格输出仍然难以直接使用,因为有意义的内容和关系被扁平化为像素,从而阻止用户检查、修改、重新排列或重用各个组件。我们制定了图像到可编辑的重建,从光栅图像中恢复结构化的、可直接操作的工件,同时保留其视觉和语义内容。核心挑战是共同满足保真度和可编辑性,这在实践中通常是权衡的。为了研究这项任务,我们引入了 DrawAI,包括代理基准 DrawAI-Bench 和重建工作流程 DrawAI-Flow。 DrawAI-Bench 涵盖科学图表、演示幻灯片、海报和图表,结合真实图像和人工智能生成的图像来反映实际的视觉创作场景。它通过 39 个标准的混合协议来评估保真度和可编辑性:基于规则的确定性指标通过直接对应来衡量属性,而特定于资产的视觉语言规则则捕获语义和感知质量,而精确匹配会产生误导。此外,我们提出了 DrawAI-Flow,一种两阶段代理工作流程,其中解析器代理将提取的元素证据转换为显式重建计划,而重建代理通过迭代代码-渲染-验证-修改循环将该计划实现为可执行图形代码。在 DrawAI-Bench 上,我们系统地评估了 5 个代理工具的 13 个模型,以研究模型功能、工具选择和工作流程设计的影响。结果表明,不同模型Harness配置的重建质量和成本差异很大,而 DrawAI-Flow 始终如一地改进了可编辑结构。