论文

当路由泄露成员身份时:MoE 路由器遥测导致的隐私泄露

When Routing Reveals Membership: Privacy Leakage from MoE Router Telemetry

模型评测模型架构AI 基础设施MoE可观测性安全与风险评测

摘要

专家混合 (MoE) 语言模型在推理过程中生成路由信息,可以记录或公开这些信息以进行监控、调试、负载分析和安全审计。与普通模型输出不同,这种遥测揭示了模型内部计算的视图,从而引发了隐私问题:它能否揭示示例是否用于微调已部署的模型?我们引入了一种路由器增强的成员推理攻击,它将传统的输出侧信号与聚合路由特征相结合,并将从独立微调的影子模型中学习到的成员分类器应用于目标模型。在三个 MoE 架构和三个数据域中,路由器遥测持续改进了强大的输出信号集合的成员推理,在所有九个设置中将 TPR 在 1\% FPR 下提高了 2.7--9.4 个百分点。泄漏在完整的微调、冻结路由器训练、LoRA 和指令调整中持续存在,并且仅通过离散专家选择、受限遥测或单个影子模型仍然可以观察到。机理分析 进一步表明,泄漏不需要特定于路由器的记忆:微调将成员信息引入隐藏表示中,而路由器即使在其参数被冻结时也会暴露该信号的投影。只有当遥测保真度降低时,扰动遥测才会减少这种额外的泄漏。我们的结果表明,路由器遥测可以将操作信号转变为微调 MoE 模型的额外隐私表面。