论文

MPCI-Bench:面向语言模型代理的多模态成对情境完整性评测基准

MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents

模型评测基准与评测资源

摘要

随着语言模型代理从被动聊天机器人进化为处理个人数据的主动助手,评估其对社会规范的遵从变得日益关键,这通常通过情境完整性(Contextual Integrity,CI)的视角进行。然而,现有CI基准大多以文本为中心,且主要强调负向拒绝场景,忽视了多模态隐私风险以及隐私与效用之间的根本权衡。本文提出MPCI-Bench,首个用于评测agentic环境中隐私行为的多模态成对情境完整性基准。MPCI-Bench由源自同一视觉来源的正负配对实例构成,并在三个层级上实例化:规范性的Seed判断、富含上下文的Story推理,以及可执行的代理动作Trace。数据质量通过三原则迭代精炼(Tri-Principle Iterative Refinement)流水线保障。对最先进多模态模型的评测揭示了系统性地无法平衡隐私与效用,以及显著的模式泄漏差距:敏感视觉信息比文本信息更频繁地被泄漏。我们将开源MPCI-Bench以促进未来agentic CI研究。

MPCI-Bench:面向语言模型代理的多模态成对情境完整性评测基准
图2:MPCI-Bench 构建流程总览。MPCI-Bench 分三个阶段构建:(A) 从图像构建成对 CI 种子;(B) 带迭代精炼的故事扩展;(C) 面向动作级评估的可执行智能体轨迹模拟。