论文

K-Bench:面向智能体部署的LLM去学习基准

K-Bench: A Benchmark for LLM Unlearning in Agentic Deployments

模型评测安全与风险评测

摘要

传统的去学习基准如TOFU和MUSE通过读取模型最终回答来验证遗忘,拒绝回答即视为遗忘。我们发现,这种模型级验证在模型作为智能体部署后无法转移。我们提出K-Bench,用于评估LLM在智能体部署场景下的去学习能力。K-Bench检查ReAct智能体暴露的六个通道,包括思维链(CoT)、工具调用和工具观测,以及引导生成的摘要。若秘密出现在任一通道中,则视为泄露。每个实验将秘密置于智能体三个来源之一(权重、提示或检索存储)。K分数针对每个来源独立计算,仅当智能体仍可用时才计为遗忘。清除回答通道并不能使秘密不可恢复。在结构化检索中,秘密以原样形式保留在工具观测通道,总体泄露率不变。当秘密位于提示或检索存储中时,TOFU和MUSE报告无泄露,但部署的智能体在22%至86%的查询中仍会泄露。当秘密存在于权重中时,二十种评估的公开方法均无法明确移除它,仅输入扰动干预在评估观察者下实现选择性遗忘。排名最高的方法随基础模型不同而变化。一种拒绝微调方法在评估的提取测试中表现稳定,但未验证其知识移除。

K-Bench:面向智能体部署的LLM去学习基准:论文配图
图3:Llama-3.1-8B、Mistral-7B与Qwen3.5-9B的基线泄漏结构。(a)在P、C、R-text、R-struct四种载体及六个可观察通道上,统计各通道的CER。(b)比较不同载体在各通道泄漏占比上的两两总变差距离。加粗白色数值超过预注册阈值τ,红色数值低于该阈值。