论文
揭示机器学习中大型推理模型的漏洞
Towards Unveiling Vulnerabilities of Large Reasoning Models in Machine Unlearning
摘要
大语言模型 (LLM) 具有强大的语义理解能力,推动数据挖掘应用取得重大进展。大型推理模型 (LRM) 进一步增强了这一点,该模型提供显式的多步骤推理轨迹。另一方面,对被遗忘权的日益增长的需求推动了机器去学习技术的发展,该技术旨在消除经过训练的模型中特定数据的影响,而无需完全重新训练。然而,遗忘也可能通过暴露额外的交互界面而引入新的安全漏洞。尽管许多研究都调查了遗忘攻击,但之前还没有关于 LRM 的研究。为了弥补这一差距,我们首先在本文中提出了 LRM 遗忘攻击,该攻击会强制产生错误的最终答案,同时生成令人信服但具有误导性的推理痕迹。由于不可微分的逻辑约束、长原理的优化效果较弱以及离散忘记集选择,该目标具有挑战性。为了克服这些挑战,我们引入了双层精确忘却攻击,该攻击结合了可微的目标函数、有影响力的词元对齐和宽松的指标策略。为了证明我们的攻击的有效性和普遍性,我们还设计了新颖的优化框架,并在白盒和黑盒设置中进行了全面的实验,旨在提高人们对 LRM 不学习管道的新兴威胁的认识。