论文

ChartBmkAgent:受 Harness 管理的图表问答基准构建

ChartBmkAgent: Harness-Governed Multi-Agent Construction of Chart QA Benchmarks from Sparse Error-Taxonomy Specifications

智能体系统Agent任务评测长程任务评测

摘要

多模态大语言模型 (MLLM) 进展迅速,而传统基准开发滞后,延迟了对新观察到的能力差距的调查。此类调查需要富有表现力的任务格式和按需构建过程:信息丰富的图表使图表问答(图表 QA)适合探索耦合的感知和推理。自动化图表 QA 构建旨在通过将已识别的差距按需转化为目标样本来缩短基准开发周期。然而,当前的方法通常将目标引导与从头生成分开:目标引导系统通常需要准备好的数据、图表或模板,而从头生成系统主要确保工件的有效性,而不明确控制新合成的需求和内容是否与外部指定的诊断目标保持一致。我们引入了 ChartBmkAgent,它通过从稀疏错误分类规范构建完整的图表 QA 样本,将已识别的能力差距转化为有针对性的诊断证据。在整个施工过程中,中央 Harness 管理专门的智能体,需要与原始错误类别一致的阶段特定证据,并记录每个验收决策的基础。在 300 个分类范围内的样本上,MLLM 的准确度范围为 32.7% 到 84.3%,具有不同的类别概况,表明生成的样本揭示了能力差异。在三个源模型比较中,有针对性的后续行动得分为 50.0%,而匹配对照的得分为 82.2% ($p=8.96\times10^{-6}$);所有六个跨模型比较都有相同的方向,展示了有针对性的验证和诊断数据生成。多个评估器模型评估每个样本是否测试了其指定的错误类别; 86.4% 符合这一标准,提供了目标保存的经验证据。

ChartBmkAgent:受 Harness 管理的图表问答基准构建:论文原图
图 1:ChartBmkAgent 概述。仅当智能体的证据满足继承义务时,Harness 才会承认智能体提出的要求和工件;失败的检查授权修改或回溯,并且承认的证据形成项目级构建跟踪。