论文
SubJudge:以批次偏好优化训练高效个性化评分模型
Multi-Dimensional Comparative Scale Construction for Efficient Personalized Subjective Judgment in High-Traffic Applications
摘要
主观判断是许多高流量应用的核心,但主观强度很难量化,而且个体之间的看法差异很大。为了应对这些挑战,我们提出了一个用于多维尺度构建的成对比较框架。通过沿着案例和个人资料维度比较案例与人对,该框架构建了捕获细粒度强度和个体差异的相对尺度。为了支持实际的高流量部署,我们优化了离线规模构建和在线推理。对于规模构建,我们将稀疏 Elo 比较与多评审投票相结合,将 $N$ 对象的比较成本从 $O(N^2)$ 削减到 $O(NK)$,每个对象的预算为 $K$ 对手,同时限制对任何单个评审的依赖。为了进行推理,我们提出了 SubJudge,这是一种通过批量偏好优化 (BPO) 进行个性化评分的 System One 模型。使用 Bradley-Terry 比较,BPO 训练模型来学习相对顺序,而 SubJudge 从第一个响应位置的数字标记概率读取连续分数,每个标准仅需要一次前向传递,并将推理复杂度降低到 $O(1)$。 PluriHarms 和 iNews 上的实验表明,我们的 9B 模型在多个指标上匹配或超过了评估的前沿 LLM。在 H100 GPU 上,SubJudge 在不同思维预算下比 Qwen3.5-9B 的平均推理延迟实现了大约 1.29\times$ 到 $261\times$ 加速。该代码可在 https://github.com/Longchentong/SubJudge. 获取