论文

个性化海市蜃楼:LLM 如何制作用户配置文件,以及为什么自我监控会产生误导

The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

模型评测基准与评测资源

摘要

具有持久内存的个性化 LLM 得到越来越多的部署,但其用户模型的 忠实性 仍未得到检验。我们研究过度推理(OI):LLM 伪造超出证据支持的用户属性的现象。我们引入了 MirageBench,其中包括 150 个平衡刻板印象、反刻板印象和中性特征的人物角色、跨越“想象力梯度”的 6 个个性化任务、由独立法官操作的四向 忠实性 分类法(针对 400 个断言的盲人注释者进行了验证:科恩的 kappa = 0.863 四级,kappa = 0.900 二进制),以及 7 个系列 12 款车型的排行榜,涉及 143616 项判定索赔。我们发现过度推断很普遍:12 个模型中的每一个都过度推断了 35%--49% 的主张(跨模型平均值 41.6%;主张加权 41.8%),本次评估中没有一个模型能够逃脱这一问题。最引人注目的是,我们发现了自我监控倒置:在模型选择层面,模型的自我评估 OI 与其判断测量的 OI 呈负等级相关(rho = -0.60,p = 0.044;探索性宽自举 CI [-0.90,+0.06],n = 12)。报告过度推理最少的模型往往被标记为捏造最多,因此自我报告的置信度对于比较模型来说是一个误导性信号,即使在单个模型中,自我审核仍然将该模型自己的声明排名中等(AUROC 0.58--0.83)。我们进一步表明,OI 是任务相关的(27%--59%),并且在多轮试验中,推断的属性近似线性累积,几乎不需要修正。 MirageBench 将外部验证(而不是模型自我报告)定位为值得信赖的个性化的更可靠基础。