论文

VisAudit:多模态智能体可视化诊断修复基准

VisAudit: Evaluating Multimodal Agents for Visual Diagnosis and Repair

智能体系统Agent任务评测

摘要

多模态智能体日益用于数据可视化任务,但在自主审查上仍有限:它们可能意识不到可视化有误、无法确定改什么、修复时破坏正确内容、或无法验证干预是否成功。现有基准主要评估图表生成、指令引导编辑或缺陷检测等预定义单能力,未能覆盖自主审查的差距。我们提出VisAudit,评估可视化诊断、修复与验证的基准:给定渲染图表与可配置辅助证据(源数据表、预期文本摘要、可视化代码),智能体迭代诊断潜在缺陷、修改并执行可视化代码、检查执行与视觉反馈,并判断何时无需进一步干预。VisAudit定义诊断修复、自主修复与开放世界验证三轨道,含跨21种图表类型、10类缺陷的1900个缺陷实例及300张初始正确图表。基准通过对经验证源可视化的受控扰动构建,经系统验证与人对齐的质量控制确保注入缺陷定义良好且可由可用证据恢复。主流多模态模型实验显示与可靠自主审查的实质差距:最强模型在自主修复设置下仅完整恢复47.4%的缺陷图表。