论文

学习结果变化的地方:多模态几何的信用可寻址推理

Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry

模型训练强化学习

摘要

多模态几何推理需要 VLM 提取精确的视觉关系并通过多步推导保留它们。现有的自由形式轨迹模糊了决定答案的决策,而轨迹级强化学习在整个响应中分配单个终端信号。我们引入了信用寻址推理,其中推理过程中暴露的语义单元也定义了学习在哪里比较替代方案并分配信用。我们用 Code-CoT 实例化了这一原理,Code-CoT 保留了图表,将视觉关系表示为可行寻址的可执行代码,并将推理组织为类型化事件,而 CE-GRPO 则使用结构先验和类型归一化熵选择事件边界,从共享前缀中采样完整的延续,并将结果差异转换为局部优势。在九个几何基准中,CE-GRPO 的平均准确度为 76.04,比 Qwen3-VL-8B 和轨迹级 GRPO 分别高出 8.09 美元和 3.43 点。它的相对优势随着中间事件的数量而增加,证明了表示优化协同设计的价值,适用于长期、依赖严重的多模态推理。