论文

现在谁主导?面向图表到代码生成的token级模态仲裁

Who Leads Now? Token-Level Modality Arbitration for Chart-to-Code Generation

模型架构混合架构

摘要

图表到代码生成要求模型读懂图表的细粒度视觉细节,并写出可复现该图表的可执行代码。现有图表到代码方法要么分别训练视觉与编码能力,要么在图表到代码数据上以两种能力纠缠的方式微调,二者都没有顾及两种能力各自的特性以及共同优化时产生的干扰。我们提出MoCA(Mixture of Cross-modal Arbitration,跨模态仲裁混合),将两种能力分离而非混合。MoCA构建于跨模态仲裁块(CAB)之上:CAB维护视觉分支与代码分支两条独立通路,并由一个轻量仲裁器在每一层、每个生成token上仲裁二者的相对贡献。我们分两阶段训练MoCA:先在自蒸馏推理轨迹上做监督热身,将视觉理解分解为显式步骤;随后进行强化学习,奖励同时覆盖推理过程与最终代码。分析显示,仲裁器学到的是结构化而非任意的分配,专家贡献随token、层与实例系统性变化。在三个基准上,MoCA相对通用域模型与图表专用模型都取得了有竞争力的表现。消融结果表明,增益不能仅归因于更大的模型规模,而来自视觉与代码分支互补初始化以及经CAB的输入条件化仲裁的共同贡献。

现在谁主导?面向图表到代码生成的token级模态仲裁:论文配图
图1:本工作的动机。图表转代码生成在不同输入上对视觉定位与代码生成的要求并不均等。上:一个视觉复杂的图表,模型在视觉理解时误读密集标签、细微颜色和多组件布局。下:一个对代码要求高的图表,模型正确感知图表,却无法生成堆叠结构、自定义坐标轴等绘图逻辑。