论文

通过小说中的规范拟像强化 LLM 中的隐私推理

Reinforcing privacy reasoning in LLMs via normative simulacra from fiction

模型训练强化学习

摘要

LLM 代理的信息处理实践与用户的上下文隐私期望大体不一致。上下文完整性 (CI) 提供了一个原则框架,将隐私定义为上下文相关规范内的适当信息流。然而,现有的方法要么通过主管助理架构使推理成本加倍,要么对狭窄的特定于任务的数据进行微调。我们建议从小说中提取规范拟像(规范和信息流的结构化表示),并使用它们通过监督学习和 GRPO 强化学习来微调 LLM。我们的复合奖励函数结合了程序化信号,包括任务清晰度(包含模式有效性、构造辨别和提取置信度)、结构完整性、内部一致性和上下文识别,以及 LLM 判断,评估模型的隐私推理是否基于源文本的规范宇宙。为了减轻过度拟合,我们引入了每次完成对比评分:每次完成都根据正确的规范宇宙和随机选择的错误规范进行评估,教导模型根据上下文进行调节,而不是记住特定于源的规范。我们评估了跨越不同社会背景的五个与 CI 一致的基准,并消除了 RL 和规范基础的贡献。在七个模型中,SFT 引入了限制信息流的保守先验,提高了对隐私相关情况的识别,但没有提高隐私判断的正确性。具有规范基础的 GRPO 在法律合规基准上取得了最高分,并且与众包的人类隐私期望具有最强的相关性,这表明源自小说的规范拟像可以教授转移到现实世界领域的上下文隐私推理。