论文

秩序的力量:用对抗表排列愚弄 LLM

The Power of Order: Fooling LLMs with Adversarial Table Permutations

模型评测安全与风险评测

摘要

大语言模型 取得了显着的成功,并越来越多地部署在涉及表格数据的关键应用程序中,例如表格问答。然而,它们对此输入结构的鲁棒性仍然是一个关键的、未解决的问题。本文证明现代 LLM 对表格数据的布局表现出严重的漏洞。具体来说,我们表明行和列的语义不变排列(不改变表基础信息的重新排列)有时足以导致不正确或不一致的模型输出。为了系统地探测此漏洞,我们引入了对抗表排列,这是一种新颖的基于梯度的攻击,可有效识别旨在最大限度地破坏模型性能的最坏情况排列。我们的大量实验表明,ATP 会显着降低多种 LLM 的性能。这揭示了不同模型大小和架构(包括最新和流行的模型)中普遍存在的漏洞。我们的研究结果揭示了当前 LLM 处理结构化数据的根本弱点,强调了为可靠的现实应用程序开发稳健排列模型的迫切需要。