论文
OTora:LLM 代理中推理级拒绝服务的统一红队框架
OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents
摘要
大语言模型 (LLM) 越来越多地部署为执行工具增强型多步骤任务的自主代理,其中延迟是实际应用程序的关键因素。然而,一个被忽视的威胁是推理级拒绝服务 (R-DoS),其中攻击者保留了任务的正确性,但通过夸大代理的推理深度或工具使用预算来降低可用性。我们介绍 OTora,这是第一个用于实例化 R-DoS 攻击的统一两阶段红队框架。第一阶段优化了对抗性触发器,该触发器使用插入感知评分和动态目标协同进化来诱导有针对性的工具调用,支持黑盒和白盒设置。第二阶段通过 ICL 引导的基因搜索生成智能体感知推理有效负载,在保持正确的任务结果的同时放大过度思考。在基于 LLaMA-70B 和 GPT-OSS-120B 等多个骨干模型构建的 WebShop、电子邮件和操作系统代理中,OTora 的推理词元和延迟速度降低了多达 10 倍,同时保持了接近基线的任务准确性。最后,我们讨论检测和限制异常推理和延迟峰值的缓解策略。该代码可从 https://github.com/llm2409/OTora 获取。