论文

Moxia:用于自解释数学推理的信任第一神经符号执行架构

Moxia: A Trust-First Neuro-Symbolic Execution Architecture for Self-Explaining Mathematical Reasoning

智能体系统Agent 工具调用

摘要

我们提出了 Moxia(以前称为 AXIOM),这是一种信任优先的神经符号架构,用于通过自然语言输入进行自解释数学推理。它的语言模型严格来说是一个规范化器:它将非正式问题文本重写为由确定性计算机代数系统(CAS)管道使用的狭窄模式,该管道派生并验证答案或放弃作为一流输出。路由遵循问题形状正则表达式、特定于模式的提示和封闭式 CAS 处理程序的 1:1:1 对齐方式,已交付 4,783 个路由,其中​​ 71% 的答案无需调用语言模型,并且零 LOST_CORRECT 回归作为常设释放门。因为答案是派生的而不是生成的,所以它的解释也是如此:每个处理程序都会发出其执行的计算的步骤跟踪,由覆盖所有 4,785 个任务文件的层呈现为散文,这些文件无法叙述处理程序未执行的步骤。推导也导出到 Lean 4:479 个任务文件 (10%) 从问题声明的数据中发出定理,其中 445 个被 Lean 内核与 Mathlib 接受;该门覆盖了夹具语料库,因此会生成实时输出,而不是经过机器检查。我们报告两个数字,但从不融合它们。在针对其设计的完整 7 类 MATH 测试拆分中,Moxia 的回答率为 90.2% (4,510/5,000),只有一个自信错误的答案(对可解析的信任度为 99.98%)。在从未针对的 MATH-500 测试中,它的回答率为 89.2% (446/500),置信错误答案为零。 1.0 pp 的差距是实质性的结果:仅仅记住问题形状的注册表会因保留数据而崩溃,而这个注册表则不会。仅规则路径以 100% 的速度满足 20,000 条记录的 lm-eval 算术基准,每条记录 1 毫秒。我们强调的不是准确度数字,而是前向动态:每个记录的弃权都是一个船舶周期后正确的候选者,因为新任务的组成不会使注册表回归。