论文
多语言与关键词对抗注入如何影响LLM相关性判断
The Effect of Multi-Lingual and Keyword Adversarial Injection on LLM Relevance Judgment
摘要
大语言模型 (LLM) 越来越多地被用作信息检索中相关性评估的自动判断器,但它们对对抗性操作的鲁棒性仍然没有得到充分的了解,特别是在多语言环境中。在这项工作中,我们使用 TREC 深度学习集合和已建立的提示框架下的两个开放权重模型,研究跨语言提示注入攻击对基于 LLM 的相关性判断的影响。我们研究了跨越不同资源级别的 8 种语言的基于指令和基于内容的注入策略。我们的结果表明,基于多语言查询的注入在夸大相关性分数方面非常有效,同时规避了现有的提示注入防御。我们进一步发现,尽管可以修改现有的防御机制来减轻此类攻击,但这些注入可以轻松地绕过它们。这些发现凸显了当前防御方法中的一个关键差距,并证明语言泛化可以充当攻击媒介,强调了 LLM 作为法官系统需要更强大和主动的评估框架。