论文

通过解开表示进行分布式代理协作的隐私保护文本清理

Privacy-Preserving Text Sanitization for Distributed Agents Collaboration via Disentangled Representations

智能体系统Agent 动作执行与治理

摘要

当分布式代理跨组织边界交换文本时,隐私泄露不仅来自显式标识符,还来自分布式签名,例如格式约定、词汇选择和句法模式。我们提出了 DiSan(Disentangled Sanitization),这是一种隐私保护的清理框架,也是用于多智能体协作的 Intern-Shannon 的内置组件。 DiSan 使用双流编码器将文本分解为保留任务语义的源不变角色子空间和保持本地的源识别样式子空间。联合原型对齐和对抗性正则化可以在不集中原始文本的情况下进行联合训练。实验表明,标识符级屏蔽是不够的:屏蔽 19.2% 的标记仅使 TF-IDF 风格归因减少了 18.6%。相比之下,DiSan 将答案级别的 PII 暴露减少了 20 倍,同时在分布式多代理 RAG 基准上保持了 83% 的答案 忠实性,并在 TF-IDF 下将安然风格归因降低了 73.2%,在神经探针下降低了 70.6%。