论文
LBA:低查询预算下的文本硬标签对抗性攻击
LBA: Textual Hard-Label Adversarial Attack under Low Query Budgets
摘要
在硬标签场景中,以低查询预算生成高质量的对抗性文本仍然是一个具有挑战性的问题。大多数现有方法依赖于贪婪算法,其中选择文本中的一个位置进行替换,然后替换其他位置。这种本地搜索方法可能无法发现高质量的对抗性示例,并且常常导致过高的查询成本。理想情况下,最佳对抗样本会考虑文本中所有可能的位置组合,但穷举搜索在计算上是不切实际的。为了应对这一挑战,我们提出了一种名为 LBA 的基于采样的方法,该方法通过整合先验知识和后验知识构建高质量对抗性示例的近似分布,并利用该分布进行采样。随着采样的进行,后验知识会更新近似分布,从而指导更有效的采样。对六种语言模型(涵盖四个数据集从小规模到大规模架构)的广泛实验表明,LBA 在所有评估指标上都显着优于最先进的基线。此外,基于 LLM 的评估表明,LBA 生成了语义上更保留且更易于理解的对抗性文本。