论文

不存在的技能:LLM Agent幻觉技能推荐的大规模研究

Skills That Don't Exist: A Large-Scale Study of Hallucinated Skill Recommendation in LLM Agents

模型评测安全与风险评测

摘要

LLM 代理通过从开放注册表下载技能来获取新功能。开发人员通常会要求代理推荐并安装技能,而不是手动浏览这些目录。这种便利隐藏了一个风险:代理经常为不存在于注册表中的技能发明名称。我们将这个缺陷技能称为幻觉。假名看似无害,但却为供应链攻击打开了大门。由于注册管理机构很少验证发布者,因此对手可以提示代理,收集其返回的假名称,在其下预先注册恶意技能,并等待受害者安装有效负载。我们对技能名称幻觉进行了首次大规模测量,评估了 12 种配置(4 个独立 LLM 和 8 个代理)中的 15,000 个提示。我们保守地认为,只有当所有实时注册中心和 GitHub 中都缺少某个名称时,我们才会将其视为幻觉。结果揭示了一个系统性漏洞:每种配置都会产生幻觉。独立 LLM 的平均率为 36.0%,代理的平均率为 36.9%,而在实际开发人员问题上则升至 43.1%。系统总共生成了 5,669 个不同的幻觉名称。至关重要的是,这些名字并不是随机的噪音。代理在提示和模型中重复相同的假名,为攻击者提供高度可靠的劫持目标。最后,我们测试了四种模型级防御,发现安全性和可用性之间存在严重冲突。最强大的检索证据约束将幻觉率从 40.8% 降低到 3.2%,但削弱了实用性:即使是防御最好的系统也只有大约六分之一的推荐推荐正确的技能。因此,技能名称幻觉是一个高度可利用的漏洞,攻击者只需付出最少的努力。解决这个问题不能仅仅依靠及时的工程或模型调整。它需要生态系统范围内的结构性改变:注册管理机构级别的名称保留和经过验证的推荐管道。