论文
用于检测LLM智能体中对抗性交互模式的低延迟欺诈检测层
A Low-Latency Fraud Detection Layer for Detecting Adversarial Interaction Patterns in LLM-Powered Agents
摘要
由大语言模型(LLM)驱动的智能体在自主任务执行、工具使用和多步推理方面展现出强大能力。然而,其不断增长的自主性也带来了新的攻击面:对抗性交互可以通过直接提示注入、间接内容攻击和多轮升级策略操纵智能体行为。现有防御策略聚焦于提示级过滤和基于规则的护栏,当风险在交互序列中逐渐显现时,这些手段往往不够充分。在本工作中,我们提出一种互补的防御机制:一个用于检测LLM智能体对抗性交互模式的低延迟欺诈检测层。我们的方法不判断单个提示是否恶意,而是基于由提示特征、会话动态、工具使用、执行上下文和受欺诈启发信号导出的结构化运行时特征,在交互轨迹上建模风险。该检测层可以用轻量级模型实现,从而支持低延迟的实时部署。为评估该框架,我们构建了一个包含12,000条多轮智能体交互的合成语料库,这些交互由参数化模板生成,用以模拟真实的智能体工作流。利用42个结构化特征和XGBoost分类器,我们的检测器速度比基于LLM的检测器快9倍以上。通过实验和消融研究,本工作表明交互级行为检测应成为LLM智能体部署时防御的核心组成部分。
