论文
ChartJudgeBench:评估 LMM Judges 的图表到代码生成
ChartJudgeBench: Evaluating LMM Judges for Chart-to-Code Generation
摘要
构建强大的图表到代码系统越来越依赖于强化学习,其有效性关键取决于奖励信号的质量。大型多模态模型 (LMM) 在联合评估图表视觉外观和任务要求方面发挥着天然的关键作用。因此,它们越来越多地被用作视觉评论家和奖励模型,但它们作为法官的可靠性在很大程度上仍未得到探索。为此,我们引入了 ChartJudgeBench,这是一种诊断视觉语言基准,用于评估图表到代码工作流程中的 LMM 判断。它包括用于成对图表比较的 1,003 个图表感知对齐 (CPA) 实例和用于图表复制和图表编辑中的二进制接受/拒绝验证的 650 个图表推理判断 (CRJ) 实例。这些任务共同模拟了代理细化和基于强化学习的图表优化所需的核心判断决策。我们对强 LMM 的评估揭示了四个系统局限性:(i) 成对比较中的位置偏差,(ii) 过度预测接受的强烈倾向,(iii) 难以匹配视觉风格和美学,以及 (iv) RL 训练模型中意外的宽大偏差。这些发现表明,当前的 LMM 判断在被用作图表到代码优化中的批评者或奖励模型之前需要进行明确的可靠性验证。代码和数据可在 ChartJudgeBench 上获取。