论文
POLAR-Bench:LLM智能体中隐私-效用权衡的诊断基准
POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents
摘要
LLM智能体越来越多地接触用户隐私数据,并在与第三方系统交互时代用户行事。用户定义什么可以分享、什么绝不能分享,智能体必须稳健地遵循这一意图,即使第三方系统采取对抗行为。我们提出POLAR-Bench(策略感知对抗基准),其中一个持有隐私策略与任务的受信模型,与一个对任务相关属性和受保护属性都进行对抗性探查的第三方模型对话。在10个领域、7,852个样本上,我们用确定性的集合隶属关系对隐私和效用打分,并沿两个正交轴变化隐私策略维度与攻击策略,为每个模型生成5×5的诊断面。我们的结果揭示出鲜明分化:当前前沿模型能隐藏99%以上的受保护属性,而1-30B量级的较小开源权重模型——用户最常在端侧或经私有推理作为自己的受信智能体运行的一类——得分明显更差,最弱者泄露过半。由此,POLAR-Bench定位出各模型意图遵循失效之处,为最要害处的隐私对齐提供了立足点。
