论文

超越输入理解:用有向非循环迹图诊断多语言数学推理

Beyond Input Understanding: Diagnosing Multilingual Mathematical Reasoning with Directed Acyclic Trace Graphs

模型评测模型行为与机制分析

摘要

大型推理模型 (LRM) 在英语中实现了强大的数学推理性能,但在许多低资源和中等资源语言中仍然不太可靠。这种差距通常被解释为无法理解非英语问题陈述。我们证明这种观点是不完整的:即使问题是用英语给出的,控制模型的推理语言也会大大降低准确性,这表明语言也会影响推理执行本身。为了研究这种效应,我们引入了 DATG,这是一个有向非循环跟踪图框架,它将推理跟踪映射到与语言无关的数学锚点和依赖关系。这使我们能够将目标语言跟踪与参考 DAG 对齐,并衡量它们是否覆盖所需的数学节点、尊重依赖边缘并避免有害的数学操作。对 Qwen3 系列跨 12 种语言的实验表明,非英语推理经常会受到锚点覆盖率降低和依赖保真度较弱的影响,尤其是在资源匮乏的语言中。受此诊断的启发,我们提出了循环重试和公式重试,这两种针对 DATG 暴露的故障模式的简单测试时间控制,并表明它们能够持续提高低资源语言中的目标语言推理性能。