论文
通过可验证的流程奖励来监控图表推理代理
Monitorable Chart Reasoning Agents via Verifiable Process Rewards
摘要
图表推理代理越来越多地用于提取关键领域中可行的见解,在多个基准上实现最先进的性能。然而,仅高基准精度不足以进行部署,利益相关者必须能够审核和验证模型如何达到其答案。现有的基于 LVLM 的图表代理要么生成仅答案的预测,要么生成难以验证的自由形式的基本原理,从而掩盖了错误是否是由于误读图表、提取错误值或错误计算而引起的。我们提出了 Chart-RVR,这是一种强化学习框架,用于训练具有可验证过程奖励的可监控图表代理。 Chart-RVR 将图表推理分解为三个可审核的块:结构、识别图表类型;证据,重构JSON底层数据表;推导,揭示计算答案的逐步轨迹。在六个域内和域外基准测试中,Chart-RVR 在同等规模的 LVLM 中实现了最先进的精度。除了准确性之外,我们还使用三角协议来评估可监控性,该协议结合了真实替代指标、预言机信息增益测量以及大语言模型作为审计师对流程可验证性和证据本地化进行评分,表明 Chart-RVR 产生的基本原理比来自 CoT 提示、SFT 和现有图表特定基线的基本原理明显更具可验证性和证据基础。