论文
评估大语言模型个性化的隐藏成本
Evaluating the Hidden Costs of Personalization in Large Language Models
摘要
虽然大语言模型 (LLM) 结合了用户个性化信号来提高可用性和帮助性,但它们越来越多地从提供平衡、信息丰富的响应转向以个人上下文(例如对话历史记录、推断偏好和用户配置文件)为条件进行优化以优化用户满意度。具体来说,我们确定了三个新出现的风险:(1)不相关的个性化,模型在不必要的上下文中引用个人信息; (2) 偏好缩小,模型强化信息回音室; (3)阿谀奉承偏见,即模型与用户意见过度一致。因此,模型可能会在不必要的情况下引用个人信息,无意中破坏响应多样性,或过度同意用户的意见。尽管人工智能助手中个性化的使用越来越多,但对其潜在副作用的系统评估仍然有限。为了弥补这一差距,我们提出了 PRISK,这是一个动态评估框架,具有自动数据生成和定制指标,揭示了当前 LLM 个性化的系统局限性以及个性化信息如何影响其响应。我们对 13 个LLM的实证分析表明,用户个人资料和检索记忆的存在不断加剧偏见,导致不相关的个性化平均下降 45.9%,偏好缩小平均下降 41.7%,阿谀奉承偏见平均下降 61.7%。
