论文
需要两个:补充自我 蒸馏 以实现 LLM 中的上下文完整性
It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs
摘要
上下文完整性 (CI) 将隐私定义为不仅隐藏信息,而且根据给定上下文的规范管理信息流。随着 大语言模型 越来越多地部署为处理敏感工作流程的个人代理,遵守 CI 变得至关重要。然而,即使是前沿模型在做出披露决策时仍然不可靠,并且现有的缓解策略常常会降低底层任务的性能。为了克服这种隐私与实用性的权衡,我们提出了 SELFCI,这是一个补充性的自我 蒸馏 框架,它将信息抑制与任务解析解耦。 SELFCI 联合优化了来自反馈的不同教师分布的两个独立的反向 KL 散度:一个鼓励保留与任务相关的信息以实现实用性,而另一个则强制执行最小且适当的披露。这种补充性的表述引入了专家产品 (PoE) 目标,使政策与能力和隐私要求的交叉点保持一致。实证评估表明,SELFCI 在不依赖昂贵的外部监督的情况下,始终优于在线强化学习算法(例如 GRPO)等竞争基线。这些趋势进一步扩展到涉及代理工作流程和积累的私人上下文的域外设置,这表明 SELFCI 提供了一条实现 CI 对齐的实用路径。