论文
抗泄露遗忘:多跳推理一致性与恢复鲁棒性的评测新基准
Leak-Resistant Unlearning: A New Benchmark for Evaluating Multi-Hop Reasoning Consistency and Recovery Robustness
摘要
评估机器学习无学习方法是理解大规模语言模型(LLMs)是否已移除敏感知识的关键。当前的无学习基准主要包含单步问题和狭窄的多步问题集。尽管有效,但它们仍然面临两个挑战:(1)知识未隔离,由于多样化的多步推理路径可能比正常查询诱导知识泄露。(2)无学习可能脆弱:通过轻量级后无学习适应等恢复攻击,部分已学知识可以被恢复,使得静态评估不足。因此,在本文中,我们引入无学习作为一种新的基准来理解在不同推理路径和恢复攻击下的LLM知识移除的鲁棒性。我们在3个模型、6种无学习方法和2个精心挑选的数据集上实验了这个基准。结果表明,现有方法对多步推理路径和恢复攻击非常脆弱。我们进一步探索了忘记质量、鲁棒性和模型实用性之间的权衡关系。
