论文
CIDER:面向隐私偏好对齐的情境化披露边界数据集
CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment
摘要
将大语言模型(LLM)与人类隐私偏好对齐,需要捕捉个体超越一般隐私规范的披露边界。然而,如何引出如此细致的偏好以在现实场景中评估对齐程度,仍存在空白。我们提出 CIDER,一个包含来自 169 名用户的 14,850 条人工标注的数据集,构成 1,650 个情境化披露边界集合,覆盖 60 个涉及违反隐私规范的信息分享的人际沟通场景。每个边界表示一个真实用户在某一场景中、给定沟通角色和 AI 中介条件下,对 9 种分享变体的披露决策。我们构建了一个任务:模型依据历史边界预测用户的披露决策,所提供的情境信息详略不一。在 12 个开源与专有模型上,仅使用 6 个历史样本的上下文内个性化即可将预测准确率提升最多 11.41 个百分点。GPT-5.4(中等推理努力)和 Claude Sonnet 4.6 等更大的模型更善于利用语义上下文来理解用户特定、情境依赖的披露偏好,从而获得更准确的预测,而较小的模型倾向于依赖基于披露粒度和可识别性的结构化启发式。个性化通常能提升预测准确率,但这种提升往往伴随各模型假阳性率与假阴性率的不均衡变化,只有 Claude Sonnet 4.6 实现了二者的均衡改善。我们的发现揭示了推理时个性化在隐私偏好建模上的前景与局限,并将 CIDER 定位为推进个性化隐私对齐的资源。
