论文
授权链:通过推理轨迹将授权内部化到大语言模型中
Chain-of-Authorization: Internalizing Authorization into Large Language Models via Reasoning Trajectories
摘要
大语言模型 (LLM) 已成为现代人工智能 (AI) 系统的核心认知组件,将内部知识与外部上下文相结合来执行复杂的任务。然而,大语言模型通常不加区别地对待所有可访问的数据,缺乏对知识所有权和访问边界的固有认识。这一缺陷增加了敏感数据泄露和对抗性操纵的风险,可能导致未经授权的系统访问和严重的安全危机。现有的保护策略依赖于严格、统一的防御,以防止动态授权。结构隔离方法面临可扩展性瓶颈,而即时引导方法则面临细粒度的权限区分。在这里,我们提出了授权链(CoA)框架,这是一种安全的训练和推理范式,可将授权逻辑内化到大语言模型的核心能力中。与被动外部定义不同,CoA 重构了模型的信息流:它在输入中嵌入权限上下文,并需要生成显式的授权推理轨迹,包括资源审查、身份解析和最终响应之前的决策阶段。通过对涵盖各种授权状态的数据进行有监督的微调,CoA将策略执行与任务响应相结合,使授权成为实质性响应的因果前提。广泛的评估表明,CoA不仅在授权场景下保持了可比的效用,而且克服了权限不匹配时的认知混乱。它对各种未经授权和对抗性访问表现出很高的拒绝率。该机制利用 LLM 的推理能力来执行动态授权,使用自然语言理解作为主动安全机制,在现代人工智能系统中部署可靠的 LLM。
