论文
现在谁主导?面向图表到代码生成的token级模态仲裁
Who Leads Now? Token-Level Modality Arbitration for Chart-to-Code Generation
摘要
图表到代码生成要求模型读懂图表的细粒度视觉细节,并写出可复现该图表的可执行代码。现有图表到代码方法要么分别训练视觉与编码能力,要么在图表到代码数据上以两种能力纠缠的方式微调,二者都没有顾及两种能力各自的特性以及共同优化时产生的干扰。我们提出MoCA(Mixture of Cross-modal Arbitration,跨模态仲裁混合),将两种能力分离而非混合。MoCA构建于跨模态仲裁块(CAB)之上:CAB维护视觉分支与代码分支两条独立通路,并由一个轻量仲裁器在每一层、每个生成token上仲裁二者的相对贡献。我们分两阶段训练MoCA:先在自蒸馏推理轨迹上做监督热身,将视觉理解分解为显式步骤;随后进行强化学习,奖励同时覆盖推理过程与最终代码。分析显示,仲裁器学到的是结构化而非任意的分配,专家贡献随token、层与实例系统性变化。在三个基准上,MoCA相对通用域模型与图表专用模型都取得了有竞争力的表现。消融结果表明,增益不能仅归因于更大的模型规模,而来自视觉与代码分支互补初始化以及经CAB的输入条件化仲裁的共同贡献。
