论文

CM-DPO:为LLM规划引入约束强度的偏好优化

CM-DPO: Constraint-Margin Direct Preference Optimization for LLM Planning

模型训练智能体系统偏好优化合成数据Agent 规划

摘要

直接偏好优化 (DPO) 同等对待所有约束违规:1 美元的预算超调和 1,000 美元的超调会产生相同的训练信号。当偏好对来自不同的模型系列时,它也容易受到长度和风格偏差的影响。我们引入了约束裕度 DPO (CM-DPO),它用从确定性符号验证器导出并按违规严重性缩放的连续裕度取代了 DPO 的二元偏好信号。硬约束和软约束通过字典目标分开,确保硬约束永远不会与偏好进行权衡。为了向 CM-DPO 提供减少偏差的训练对,我们在一个称为 SynPlan-R 的框架内,通过程序生成的约束配置文件 (DCCG) 和推理教师的最小编辑蒸馏 (RT-MED) 生成偏好数据。在 TravelPlanner、NaturalPlan 和分布外 PlanBench 上,使用 CM-DPO 微调的 8B 模型实现了 89.2% 的通过率和 93.4% 的解决率,以低 13 倍的延迟匹配多智能体系统,同时在 unseen Blocksworld 上的性能比 GPT-4o 高出 9.2 分。