论文

PrivacyAlign:LLM 代理的上下文隐私对齐

PrivacyAlign: Contextual Privacy Alignment for LLM Agents

模型训练奖励建模与过程监督

摘要

代表用户行事的人工智能代理不断做出决策,为了让用户信任他们的代理,这些决策必须符合他们的实际需求。对于代理来说,隐私是一个重要的协调问题:代理发出的每条消息、帖子或工具调用都是关于什么内容适合共享、与谁共享以及在什么条件下共享的上下文判断。由于此类判断取决于社会期望和规范,因此人类判断不仅可以给侵犯隐私行为贴上标签,还可以帮助定义侵犯隐私行为。虽然现有的工作依赖于不可靠的代理来进行训练和评估,但我们将人类判断置于代理隐私协调的中心。我们引入了 PrivacyAlign,这是一个包含 1,350 个样本的数据集,其中包含来自 599 个独特注释者的 3,516 个详细注释,涉及当前 LLM 实际泄漏的不同场景,并用它来将对齐训练和自动评估建立在人类隐私规范的基础上。在这些注释的基础上,我们首先表明,根据人类注释和对相同提示的参考响应的解释来判断 LLM 使他们的判断更加可靠。然后,我们引入注释条件奖励模型,该模型使用这些注释在 RL 期间对新响应进行评分,并表明使用此奖励训练的小型开放权重代理更好地符合人类隐私规范,在 PrivacyAlign 和现有代理隐私基准上取得了巨大进步。