论文

DiffPDE:以掩码扩散语言模型求解偏微分方程

DiffPDE: Masked Diffusion Language Models as PDE Solver

模型推理模型训练强化学习解码与生成控制RLVR

摘要

现有的综合偏微分方程 (PDE) 求解器的方法主要依赖于自回归模型,但它们的全局从左到右解码在解决固有的局部错误时会产生大量冗余。在这项工作中,我们挑战这种低效的范式,并提出 DiffPDE,这是一种利用离散扩散语言模型进行目标代码修复的框架。通过引入局部重新掩蔽和填充策略,DiffPDE 仅重新生成错误区域,同时保留正确的上下文,自然地将生成与 PDE 错误的稀疏性质对齐。此外,为了处理需要顺序干预的耦合错误,我们提出了迭代调试 GRPO(ID-GRPO),这是一种强化学习方案,可以通过中间奖励在单个轨迹内进行多轮调试。 PDEBench 上的实验表明,DiffPDE 实现了有竞争力的精度,优于同规模的 AR 模型,并显着加快了修复速度。

DiffPDE:以掩码扩散语言模型求解偏微分方程:论文配图
图1:调试模式的比较。AR模型通过相继的全文再生来修复错误解答器,而 DiffPDE 仅重塑错误的区域,并通过在周围全方位进行填充来修复它。