论文

多利益相关方LLM对齐:将估计与聚合解耦

Multi-Stakeholder LLM Alignment: Decomposing Estimation from Aggregation

模型评测评测方法与指标

摘要

多利益相关方任务要求单个输出同时满足偏好相互冲突的用户。整体式LLM裁判将效用估计与效用聚合混为一体,导致隐式权重不稳定。我们在实证和理论上表明,这种聚合特有的“权重噪声”在利益相关方满意度分散时会造成巨大的分数偏移;在我们的实验中,这些由权重引起的偏移还随利益相关方数量增加而增大。我们提出DecompR:在候选打分之前,从查询结构中固定经反事实校准的权重,同时独立估计各角色效用,从而消除依赖候选的权重漂移并降低估计噪声。

多利益相关方LLM对齐:将估计与聚合解耦:论文配图
图 1:(左)一位 LLM 代理将相互冲突的利益相关者偏好综合到一个共享计划中。 (右)整体LLM法官隐式分配每个利益相关者的效用 uiu_{i} 和权重 wiw_{i};对同一计划的重复评估会产生不同的隐含权重,从而产生不同的标量奖励。