论文

PolicyMem:用于 LLM 治理的几何策略内存

PolicyMem: Geometric Policy Memory for LLM Governance

摘要

随着大型语言模型 (LLM) 越来越多地部署在现实世界的高风险应用程序中,有效的治理变得至关重要。现有的防护措施主要遵循两种范式:基于学习的防护措施提供强大的语义区分,但将策略行为与经过训练的模型和分类法结合起来,而可编程框架提供灵活的控制,但需要大量的手动提示和工作流程工程。两者都没有将策略外部化为可重用的操作状态,使得在检测、干预和验证过程中一致地重用策略证据变得困难。在本文中,我们介绍了PolicyMem,一种几何策略存储器,它将自然语言策略外部化为由共享表示空间中的低秩子空间表示的可重用几何存储器对象。存储器编写器将自然语言策略编译到策略存储器槽中,查询-响应对通过投影能量读取策略存储器。由此产生的政策证据概况直接调解安全判决,并重新用于政策归因和干预后验证。与响应重写器相结合,PolicyMem 为 LLM 治理启用了检测-重写-验证循环。在五个广泛使用的基准中,PolicyMem 实现了最先进的不安全行为检测,同时通过共享策略内存实现有效的策略归因、重写和干预后验证。