论文
PolyAlign:有条件的人体分布对齐
PolyAlign: Conditional Human-Distribution Alignment
摘要
后训练 方法(例如监督式 微调 (SFT) 和偏好优化)通常会将语言模型调整为单一全局助理行为。虽然可以有效提高平均帮助度,但它可以抑制人类反应在语言、任务和对话环境中的自然变化。我们将这个问题作为有条件的人类分布对齐来研究:模型应该匹配适合当前交互上下文的人类响应分布,而不是通用的响应风格。我们引入了 PolyAlign,一个分布感知对齐框架,它将双语交互数据组织成由语言、交互轨迹、响应族和长度定义的特定桶的人类参考分布。 PolyAlign 将存储桶感知 SFT(平衡异构存储桶之间的优化)与人类分布偏好优化 (HDPO) 相结合,后者使用评估器估计的与特定存储桶的人类支持的距离来规范偏好学习。在涵盖英语和中文单轮和多轮设置的双语评估套件中,PolyAlign 提高了条件自然度和分布 忠实性,同时保留了竞争性任务效用。结果表明,后训练 应该超越全局对齐目标,转向与人类响应分布的交互感知对齐。