论文

评估大语言模型个性化的隐藏成本

Evaluating the Hidden Costs of Personalization in Large Language Models

模型评测上下文与知识记忆评测方法与指标Agent记忆

摘要

虽然大语言模型 (LLM) 结合了用户个性化信号来提高可用性和帮助性,但它们越来越多地从提供平衡、信息丰富的响应转向以个人上下文(例如对话历史记录、推断偏好和用户配置文件)为条件进行优化以优化用户满意度。具体来说,我们确定了三个新出现的风险:(1)不相关的个​​性化,模型在不必要的上下文中引用个人信息; (2) 偏好缩小,模型强化信息回音室; (3)阿谀奉承偏见,即模型与用户意见过度一致。因此,模型可能会在不必要的情况下引用个人信息,无意中破坏响应多样性,或过度同意用户的意见。尽管人工智能助手中个性化的使用越来越多,但对其潜在副作用的系统评估仍然有限。为了弥补这一差距,我们提出了 PRISK,这是一个动态评估框架,具有自动数据生成和定制指标,揭示了当前 LLM 个性化的系统局限性以及个性化信息如何影响其响应。我们对 13 个LLM的实证分析表明,用户个人资料和检索记忆的存在不断加剧偏见,导致不相关的个​​性化平均下降 45.9%,偏好缩小平均下降 41.7%,阿谀奉承偏见平均下降 61.7%。

评估大语言模型个性化的隐藏成本:论文配图
图2:第1阶段:我们构建个性化三重(说明 uu, memory H(u)H(u)H(u),查询 qq):根据真实的Reddit数据和受约束驱动的合成生成;记忆是基于uu的多方向对话,但不包括有助于回答qq的内容;查询来自基准适应、模板生成或Renddit衍生的问题。第二阶段:在个性化的三个阶段中,我们衡量三种风险:(1) 与个人化无关;(2) 偏重狭义;(3) 使用自动计量法和大语言模型判断法。我们还将分析和归属结果汇总起来,并进行通知协议检查。