论文
IChart2Code:在浏览器中核验交互图表代码生成
IChart2Code: Benchmarking Multimodal Large Language Models for Interactive Chart Code Generation
摘要
交互图表代码生成要求模型重现参考图表外观与底层数据,并正确实现指定用户交互触发的状态变化。现有图表到代码基准聚焦静态输出,缺少交互规格、浏览器执行及交互后验证的任务表示和评测协议。我们提出IChart2Code,包含跨20种图表形式和13类数据的377个任务,以及六类共1209项交互要求。每个任务提供参考截图、任务局部数据和自然语言交互要求,以可执行HTML/JavaScript为目标输出。我们还构建浏览器评测协议,包括可执行性门禁及三个按评分规则指导的维度:数据忠实度、静态视觉正确性、交互正确性。协议在沙箱浏览器中核验运行可行性、与局部数据的一致性、初始渲染对截图的忠实度,以及交互引发的状态变化。MLLM评审使用浏览器观测,按规则评估三个得分维度的任务专用项目,对照经裁决人类标注,整体项目级F1为0.8844。我们另提出轨迹指导的双Agent框架TRAIL:Inspector生成任务专用检查,在浏览器中执行,用轨迹诊断失败并给出结构化修复反馈。四种MLLM平均来看,TRAIL相对于直接提示在四个维度分别提高7.89、4.98、3.45和4.47个百分点。