论文

优先选择多种成功轨迹的直接多样性优化 后训练

Direct Diversity Optimization for Diverse Successful Trajectories in Preference Post-Training

模型训练偏好优化

摘要

用于顺序决策任务的 LLM 代理通常使用轨迹级结果标签进行后训练,但此类标签几乎无法提供监督来保留来自同一决策状态的多个成功分支。我们将这个问题作为成功的策略覆盖范围来研究:一个模型在固定的部署预算下在多大程度上实现了不同的成功策略。我们提出了直接多样性优化 (DDO),这是一种离线 后训练 方法,它将分歧树收集 (DTC) 与参考相对目标赔率目标 (RTO) 相结合。 DTC 构建基于共享决策状态的状态对齐分支集,RTO 训练模型以匹配参考相对目标而不是成功的替代方案。在 BabyAI、BabaIsAI 和 WebShop 的 后训练 方法中,DDO 实现了最强的任务成功率和成功的策略覆盖率。它还在局部动作替换后实现了最高的恢复率,并且比仅成功的模仿和解码时间多样化控制更高的任务成功率和覆盖率。