论文
双向偏好综合:从边界失败中学习提示条件偏好
Bidirectional Preference Synthesis: Learning Prompt-Conditioned Preferences from Boundary Failures
摘要
基于校正的离线偏好管道通常仅将模型失败视为原始提示下被拒绝的响应。对于边界故障,这种监督是不完整的:违反给定指令但一致满足附近意图或约束设置的响应。我们引入了双向偏好综合(BPS),这是一种用于标准直接偏好优化(DPO)的数据构造方法,使这种缺失的提示依赖性变得明确。对于每个经过验证的边界故障,BPS 在原始提示下保留传统的前向对,并在合成的已实现提示下添加反向对,因此相同的响应在错误的地方被拒绝,在正确的地方被选择,而无需更改 DPO 目标、训练奖励模型或需要在线采样。在 Qwen3-4B-Instruct-2507 上,BPS 保留原始侧成对排名,同时将留出交叉锚点上的实现侧排名精度从 6.8% 提高到 62.3%,在 Kimi-K2.6 交叉教师模型探针下也有类似的转变。盲人审计支持预期的反向偏好方向,下游评估显示在多语言多轮指令跟踪中与 Forward-DPO 有着最明显的分离,在Agentic、工具使用和代码检查上具有一致的能力保留模式。
