论文

DISA:用于分布匹配的离线重要性采样 LLM-RL

DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

模型训练强化学习

摘要

现代推理代理越来越多地评估其为给定输入生成多个有效解决方案路径、计划或工具使用跟踪的能力。标准奖励最大化 RL 往往会崩溃到最容易强化的高奖励模式,而分布匹配 RL 的目标是在整个奖励形状的解决方案集中分配概率质量。实现这一目标需要在轨迹空间上计算与提示相关的配分函数。由于现有的分布匹配方法与策略一起在线学习该分配函数,因此分配函数中的校准错误直接扭曲策略更新,并且仍然无法独立诊断。我们引入了 DISA(解耦重要性采样锚定的缩写),它将这个校准问题移到了 RL 循环之外。 DISA 离线绘制提案轨迹,通过重要性采样估计配分函数,并在策略优化开始之前冻结所得配分函数估计。这种解耦保留了分布匹配目标,同时将配分函数估计与数据、梯度、损失和诊断中的策略学习严格分开。根据经验,在跨六个数学和三个代码基准的两个开放权重主干上,DISA 匹配或超过在线耦合分布匹配基线 FlowRL,在数学平均值上优于奖励最大化基线 GRPO 和 GSPO,并在相同的离线轨迹上超过 LoRASFT 蒸馏 高达 13.8 Mean@8 点。 LLM 作为法官的评估进一步表明,DISA 比奖励最大化基线保留了更多的策略层面多样性,并且提案强度和逆温度的敏感性研究遵循分析预测的偏差-方差模式。