论文

按位置排名:LLM Listwise 推荐器中作为可利用攻击面的订单敏感性

Ranked by Position: Order Sensitivity as an Exploitable Attack Surface in LLM Listwise Recommenders

模型评测安全与风险评测

摘要

在推荐系统中用作列表重排序器的 大语言模型 (LLM) 在将候选集序列化为提示时会遭受位置偏差。我们证明这种顺序敏感性创建了一个可利用的攻击面:攻击者可以仅通过重新排序候选者来将标签 0 目标提升到 top-$k$,而无需更改项目内容、标签或模型参数。我们引入 $\mathrm{promo}@k$ 来量化此漏洞,测量可以通过排列提升到 top-$k$ 排名的 label-0 目标的比例。通过对三个领域(MovieLens、Amazon Books 和 Amazon Fashion)进行评估,$\mathrm{promo}@5$ 在 $R$ = 50 个订单的攻击预算下达到 0.57。此外,普通排列稳定性可以在不运行攻击的情况下预测漏洞。虽然双向 T5 编码器评分器减少了暴露,但排列一致性正则化和架构不变性有效地缓解了这种情况。逐点评分避免了偏差问题,但会降低排名质量。这些结果表明,列表 LLM 重新排序中的输入候选顺序是与安全相关的攻击向量。代码和数据可在 https://github.com/geoz-lab/position_bias_attack 获取。