论文

基于 LLM 的推荐中的语言偏差调查

An Investigation of Linguistic Biases in LLM-Based Recommendations

模型评测鲁棒性、公平性与可信度评测

摘要

我们使用 Yelp 开放数据集(Yelp Inc.,2023)和沃尔玛产品评论数据集(PromptCloud,2020)研究了基于 LLM 的餐厅和产品推荐中的语言偏差,并给出了南美英语(AE)、印度英语(IE)和代码转换印地语英语方言的不同提示。我们将按美食类型和产品类别平衡的餐厅和产品名称列表添加到 LLM 的提示中,并且我们在冷启动设置中零样本提示 LLM,以便从这些列表中为每个方言变化的提示选择前 20 个餐厅和产品推荐。我们在 20 个种子中使用不同的列表样本来提示 LLM,以便更好地概括,并汇总每个种子、问题/提示和 LLM 模型的每个菜系类型和每个类别的响应计数。我们为每个模型系列和主题(餐厅/产品)运行混合效应回归模型,以总响应计数作为因数,并通过估计边际均值差异的事后成对检验对固定效应进行似然比检验,以按模型大小和方言类型调查推荐计数的组级差异。结果表明,方言在使用 milstra-small-3.1 模型测试的模型中选择的餐厅类型中发挥着重要作用,并且测试的 llama-3.1 系列模型对印度英语和代码转换提示更敏感。在产品推荐方面,llama-3.1-70B-模型对七类中的四类中的代码转换提示特别敏感,当分别对较大和较小的模型使用印度英语和代码转换提示时,会看到更多的美容和家居类别推荐。基于模型大小的差异没有看到广泛的趋势,根据方言类型的模型大小有不同的建议。