论文

纠正 大语言模型 质量估计的稀疏用户反馈中的选择偏差:多代理分层贝叶斯方法

Correcting Selection Bias in Sparse User Feedback for Large Language Model Quality Estimation: A Multi-Agent Hierarchical Bayesian Approach

模型评测评测方法与指标

摘要

[节选] 生产 LLM 部署收到来自非随机部分用户的反馈:拇指大部分位于满意度分布的尾部,而对它们的简单平均值可能会与真实的系统质量相差 40-50 个百分点。我们将其视为主题和情感分层的选择偏差问题,并提出了一种三代理分层贝叶斯管道,该管道不需要在个体交互上使用 真值 标签。主题聚类代理通过 UMAP + HDBSCAN 在文本嵌入上对流进行分区;偏差建模代理在 NUTS 下拟合两阶段分层 Beta-二项式,通过部分池化推断每个主题的选择率 $s_c$ 和质量 $q_c$;综合代理根据真实主题流行度 $\hatπ_c = n_c/N$ 重新加权 $q_c$,以报告具有可信区间的偏差校正聚合后验 $\bar Q = \sum_c \hatπ_c q_c$,以及用于在线重新校准的漂移信号。验证使用 UltraFeedback(N=10,232 保留交互,$C=18$ 集群,$Q^\star=0.6249$)以及模拟主题和情感相关的选择偏差。我们将五个贝叶斯变体与 Naive 和 IPW 基线进行比较。反馈通道上的温和先验(典型的正反馈率和负正比,均可从任何没有标签的生产仪表板中读取)使分层通知保持在 $Q^\star$ 的 4-13 pp 范围内,偏差比从 1:1 扫描到 30:1,在 $κ_{\max}=10$ 的 50/50 随机种子重复中,95% 的可信区间覆盖 $Q^\star$。如果没有通道侧先验,每个弱先验变体都会错过 $Q^\star$ 22-33 pp:每个簇的足够统计数据承认一个同样良好拟合的单参数族,而偏差通道上的先验(而不是潜在质量)是打破简并性的原因。