论文
用于对话音频均衡的直接偏好密度对齐
Direct Preference Density Alignment for Conversational Audio Equalization
摘要
大型语言模型对齐通常依赖于学习的代理奖励模型,这会显着增加训练期间的内存占用,并且容易出现不稳定和奖励作弊行为。虽然像直接偏好优化(DPO)这样的离线方法绕过了奖励模型,但它们失去了执行在线探索的能力。如果不应用优化约束,这可能会导致有限的连续空间中的格式崩溃。为了解决这个问题,我们提出了直接偏好密度对齐:一种替代框架,无需学习代理奖励模型,同时严格保留在线强化学习的优势。我们利用大规模用户数据(约 90,000 个样本)构建非参数偏好密度图,建立经验奖励曲面。除了取消奖励模型之外,直接偏好密度对齐还可以将组相对策略优化(GRPO)的在线结构基础与 DPO 的有针对性的离线细化相结合。我们表明,这种 GRPO+DPO 组合实现了最高性能,并且在盲音频均衡聆听测试中,使 1.5B 参数模型能够与精心设计的 GPT-4o 迷你基线实现感知奇偶校验,仅使用一小部分推理计算。