论文

语义推理去噪:用语义运算符纠正语言模型推理

Semantic Reasoning Denoising: Correcting Language Model Reasoning with Semantic Operators

模型训练监督微调与指令调优

摘要

大语言模型 可以产生流畅的推理轨迹,其局部语义错误传播到不正确的结论,而不受约束的自我纠正可能会保留、放大或引入错误。现有的扩散语言模型提供迭代细化,但通常将噪声定义为标记屏蔽或替换,而不是推理过程中的错误。我们提出了语义推理去噪(SRD),这是一种用于自然语言推理轨迹的算子马尔可夫去噪方法。 SRD 表示具有可执行错误运算符的语义噪声,这些运算符描述错误类型、错误位置以及损坏和修复的命题。组合这些运算符会构造出逐渐变得更加嘈杂的状态。在训练过程中,模型学习识别当前轨迹中活跃的语义噪声并重建配对的相邻低噪声状态。在推理过程中,噪声水平感知去噪会重复预测逆算子并检查其是否适用,因此每次执行的更新都会朝着稳定轨迹进行局部移动。在涵盖数学、代码、知识和常识的六个领域内基准测试中,SRD 将最强的相同骨干基准线平均提高了 3.2 个点。在七个跨数据集传输目标上,它仍然与 Llama-3-8B-Instruct 具有竞争力,并将最强的 Qwen3-8B 基线平均值提高了 2.9 个百分点。对噪声源、目标和去噪深度的分析进一步表明,结构化语义噪声预测和迭代算子执行是改进的核心。