论文

指令渗漏:提示组合式智能体系统中的跨模块干扰

Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems

模型评测评测方法与指标

摘要

提示组合式智能体系统的从业者报告一种反复出现的失败模式:编辑一个提示模块会静默改变其他模块的行为——尽管无共享变量或可执行依赖。我们把它形式化为组合行为泄漏(CBL):共享上下文窗口的模块间干扰。CBL由架构非隔离性使能:transformer自注意力在拼接模块间不提供形式边界。我们在部署的职位评估智能体(Claude Sonnet 4.6,144次试验)上以可复用的三通道协议探查CBL——沿体量、内容与形式扰动非焦点模块。只有内容通道产生可检测的配对效应(Cohen's d=0.63,bootstrap 95% CI不含零);没有推荐翻转——这是标准QA不可见的亚阈值状态——但在部署智能体成千上万次决策间复利累积。CBL与已知智能体失败轴(对抗注入、认知退化、多智能体故障传播、隐私泄漏)正交。我们贡献可操作定义、可复用协议、可证伪预测集与系统类刻画——确立跨模块干扰测量为提示组合式智能体评估的必要项。