论文
MCPHunt:多服务器MCP智能体中跨边界数据传播的评估框架
MCPHunt: An Evaluation Framework for Cross-Boundary Data Propagation in Multi-Server MCP Agents
摘要
多服务器MCP智能体带来一个信息流控制问题:忠实的工具组合可以将各自无害的读写权限转化为跨边界的凭据传播——这是工作流拓扑的结构性副作用,并不必然是恶意的模型行为。我们提出MCPHunt,据我们所知是首个隔离非对抗性、逐字凭据跨多服务器MCP信任边界传播的受控基准,包含三项方法学贡献:(1)基于金丝雀的污点跟踪,将传播检测简化为客观的字符串匹配;(2)环境受控的覆盖设计,包含风险、良性和困难负例条件,用于验证流水线的健全性并控制凭据格式混淆;(3)CRS分层,将任务要求的传播(对逐字传输指令的忠实执行)与违反策略的传播(尽管可以选择脱敏仍包含凭据)区分开来。在来自5个模型、横跨147个任务和9类机制的3,615条主基准轨迹中,所有模型的违反策略传播率达到11.5-41.3%。这种传播具有路径特异性(跨机制差异达25倍),并集中在浏览器中介的数据流中;困难负例控制提供的证据表明,生产格式的凭据并非必要——由提示词引导的跨边界数据流即已足够。跨3个模型的提示词缓解研究将违反策略的传播最多降低97%,同时保留80.5%的效用,但有效性随指令遵循能力而变化——表明仅靠提示词层面的防御可能不够。代码、轨迹和标注流水线以MIT和CC BY 4.0许可发布。