论文

内化几何定律:从解算器残差中学习以实现精度关键的生成

Internalizing Geometric Law: Learning from Solver Residuals for Precision-Critical Generation

模型训练奖励建模与过程监督

摘要

大语言模型 经常在技术制图和机械设计等精度关键领域产生幻觉,这些领域的输出必须满足严格的几何约束。我们研究自然语言的开放式几何综合:将自由形式的描述转化为精确的结构,其实体必须同时满足数十个相互作用的约束。为了使这个问题变得容易处理,我们发布了 PyGeoX,这是一种可编程的几何 DSL,它将声明性约束编译为可微的损失,以及 PyGeoX-Bench,这是一个包含 300 个问题的分层套件,具有每个约束可验证的奖励。使用 PyGeoX 作为验证器,我们确定了一种称为离群值梯度掩蔽的故障模式:在全局范数奖励下(通过单个范数聚合残差的任何方案,例如 $\exp(-\mathrm{MSE})$),单个离群值约束可以使所有其他约束的学习信号无效。为了解决这个问题,我们提出了饱和附加奖励(SAR),它将奖励分解为有界的每个约束项,即使在严重违规的情况下也能保留部分进度并确保梯度一致。与基于 MSE 的奖励(几何求解器的自然基准)相比,SAR 将硬层求解率提高了 2.3倍,并且由此产生的 8B 模型在该基准上与更大的前沿系统具有竞争力。我们在 https://github.com/Huawei-AI4Math/PyGeoX 发布了引擎、基准测试和数据。