论文

恶意知识编辑下知识密集型推理的安全风险基准测试

Benchmarking Safety Risks of Knowledge-Intensive Reasoning under Malicious Knowledge Editing

模型评测安全与风险评测

摘要

大语言模型(LLM)日益依赖知识编辑来支持知识密集型推理,但这种灵活性也引入了关键安全风险:攻击者可以注入恶意或误导性知识,破坏下游推理并导致有害后果。现有知识编辑基准主要关注编辑效果,缺乏一个系统评估被编辑知识对推理行为之安全影响的统一框架。为填补这一空白,我们提出EditRisk-Bench,一个系统评估恶意知识编辑下知识密集型推理安全风险的基准。不同于主要强调编辑成功率、泛化性和局部性的既有基准,EditRisk-Bench聚焦于注入知识如何影响下游推理行为与可靠性。它将多样的恶意场景(包括虚假信息、偏见和安全违规)、多层级的知识密集型推理任务以及代表性编辑策略整合进一个统一评估框架,衡量攻击有效性、推理正确性与副作用。在开源与闭源LLM上的大量实验表明,恶意知识编辑能够稳定地诱发错误或不安全推理,同时大体保留通用能力,使此类风险难以检测。我们进一步识别出影响这些风险的若干关键因素,包括编辑规模、知识特性与推理复杂度。EditRisk-Bench为理解和缓解LLM知识编辑中的安全风险提供了一个可扩展的测试平台。

恶意知识编辑下知识密集型推理的安全风险基准测试:论文配图
图2:EditRisk-Bench概述,它集成了知识密集型QA任务、面向风险的恶意知识场景、代表性编辑方法和统一的评估管道。