论文
基于 LLM 的推荐系统中的不确定性与公平性感知
Uncertainty and Fairness Awareness in LLM-Based Recommendation Systems
摘要
大语言模型(LLM)通过利用广泛的上下文知识实现强大的零样本推荐,但预测不确定性与内嵌偏见威胁可靠性与公平性。本文研究不确定性与公平性评估如何影响 LLM 生成推荐的准确性、一致性与可信度。我们引入一个包含精选指标的基准,以及一个在电影与音乐两个领域对八个人口统计属性(31个类别值)进行标注的数据集。通过深入的案例研究,我们量化预测不确定性(经熵),并证明 Google DeepMind 的 Gemini 1.5 Flash 对某些敏感属性表现出系统性不公平:测得的基于相似性的差距 SNSR 为0.1363、SNSV 为0.0507。这些差距在错别字与多语言输入等提示扰动下持续存在。我们进一步把人格感知公平性整合进 RecLLM 评估流水线,揭示与人格相关的偏见模式,并暴露个性化与群体公平之间的权衡。我们提出一种新的面向不确定性的 RecLLM 评估方法,给出深入不确定性案例研究的实证洞见,并引入一个带人格画像信息的公平性基准,推进 LLM 推荐的可解释性与公平性。这些贡献共同为更安全、更可解释的 RecLLM 奠定基础,并推动面向可信部署的多模型基准与自适应校准的未来工作。
