论文
超越拒答:探究 Agentic 自我纠正处理语义敏感信息的极限
Beyond Refusal: Probing the Limits of Agentic Self-Correction for Semantic Sensitive Information
摘要
虽然针对结构化 PII 的防御已趋成熟,大语言模型(LLM)带来了新威胁:语义敏感信息(SemSI),即模型推断敏感身份属性、生成损害名誉的内容或幻觉出可能错误的信息。LLM 能否在不破坏效用的情况下自我调节这类复杂、依赖上下文的敏感信息泄露,仍是一个开放的科学问题。为此,我们提出 SemSIEdit,一个推理时框架,其中 Agentic“编辑者”迭代地批评并重写敏感片段以保持叙事流畅,而非简单拒绝回答。我们的分析揭示了一个隐私-效用帕累托前沿:这种 Agentic 重写将三类 SemSI 的泄露减少 34.6%,同时仅带来 9.8% 的边际效用损失。我们还发现规模依赖的安全分化:大型推理模型(如 GPT-5)通过建设性扩展(增加细节)实现安全,而容量受限的模型则退回到破坏性截断(删除文本)。最后,我们识别出一个推理悖论:推理时推理通过使模型能做更深的敏感推断而抬高基线风险,同时又赋能防御执行安全重写。
