论文
FORGE:针对深度研究智能体的研究轨迹劫持攻击
FORGE: Research-Trajectory Hijacking Attacks on Deep Research Agents
摘要
深度研究智能体把开放式查询分解为子任务、多轮检索网页证据并综合长报告。该工作流制造了一个规划层投毒面:进入检索池的对抗文档可以引导后续提问,把局部注入放大为报告级污染。我们提出FORGE(为智能体利用而伪造编排推理链):结合文档内推理伪造与文档间链条协调的两级攻击,劫持子任务规划。我们进一步引入PRISM度量——按认知类型为被感染报告论断加权——以及根查询锚定(RQA):把递归后续生成绑定到根查询的轻量防御。跨25个查询:网络FORGE以五份注入文档达到26.4% PRISM,并表现出深度迁移——递归综合把被投毒内容从显性框架转为事实前提。在10查询防御子集上:RQA把PRISM从38.5%降到18.3%。