论文

DecodingTrust-Agent平台(DTap):面向AI智能体的可控交互式红队平台

DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents

智能体系统Agent任务评测

摘要

AI智能体日益跨领域部署,经长程高风险动作执行自动化复杂工作流。因其高能力与高灵活性,此类智能体引发重大安全顾虑。越来越多的真实事件表明,对手可轻易操纵智能体执行有害动作:泄露API密钥、删除用户数据或发起未授权交易。评估智能体安全本质困难:智能体在动态不可信环境中运行,涉及外部工具、异构数据源与频繁用户交互;而用于大规模风险评估的现实、可控、可复现环境仍基本空缺。为填补缺口,我们提出DecodingTrust-Agent平台(DTap):首个面向AI智能体的可控交互式红队平台,横跨14个真实领域、50余个仿真环境,复刻Google Workspace、Paypal、Slack等广泛使用的系统。为扩展DTap中的智能体风险评估,我们进一步提出DTap-Red:首个自主红队智能体,系统探索多样注入向量(提示、工具、技能、环境及其组合),自主发现适配不同恶意目标的有效攻击策略。

DecodingTrust-Agent平台(DTap):面向AI智能体的可控交互式红队平台:论文配图
图 1:DecodingTrust-Agent 平台通过高级红队为 AI 代理提供全面的安全评估,涵盖间接和直接威胁模型。