论文
密度引导响应优化:经由内隐接受信号的社区依据对齐对齐
Density-Guided Response Optimization: Community-Grounded Alignment via Implicit Acceptance Signals
摘要
部署于在线社区的语言模型必须适应随社会、文化与领域情境而异的规范。既有对齐方法依赖显式偏好监督或预定义原则,对资源充足的环境有效,但把多数在线社区排除在外——尤其是缺乏机构支持、标注基础设施或围绕敏感话题组织的社区——在这些地方偏好引导成本高、有伦理风险或与文化错位。我们观察到,社区已经通过接受、互动和允许留存的内容隐式表达偏好。我们表明这种接受行为在表示空间中诱导可测量的几何结构:被接受的回答占据反映社区规范的高密度连贯区域,被拒内容落在稀疏或错位区域。我们把这一结构用作对齐的内隐偏好信号,提出密度引导响应优化(DGRO),无需显式偏好标签即可把语言模型对齐到社区规范。利用带标注偏好数据,我们证明局部密度可恢复成对社区判断,表明几何结构编码了有意义的偏好信号。随后,我们把 DGRO 应用于横跨平台、话题和语言、标注稀缺的多社区场景。DGRO 对齐的模型持续产出比监督式与提示式基线更受人工标注者、领域专家和模型裁判青睐的回答。我们把 DGRO 定位为显式偏好监督不可得或与实际实践错位时社区对齐的实用替代,并讨论从涌现接受行为学习的意涵与风险。
