论文
AgentDoG 1.5:面向 AI 智能体安全与防护的轻量可扩展对齐框架
AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security
摘要
OpenClaw 等现代开放世界智能体展现出强大的跨环境执行能力,却也引入了大量新的安全风险来源。与此同时,先进的前沿 AI 模型大幅降低了攻击门槛,使当前的智能体对齐框架难以满足真实世界部署的要求。为应对这些新出现的威胁,我们提出一个轻量且可扩展的智能体安全对齐框架。具体而言,我们更新了智能体安全分类体系,以涵盖来自 Codex 与 OpenClaw 执行场景的新型风险。我们进一步构建了由分类体系引导、并经影响函数净化(influence-function purification)的数据引擎,仅用约 1k 样本训练出轻量的 AgentDoG 1.5 变体(0.8B、2B、4B 与 8B 参数),性能可与领先的闭源模型(如 GPT-5.4)比肩。基于 AgentDoG 1.5,我们构建了一个高效的智能体安全 SFT 与 RL 训练环境,将 Docker 级环境中的部署开销降低了两个数量级。最后,我们将 AgentDoG 1.5 部署为免训练的在线护栏(guardrail),用于实时安全审核。大量实验结果表明,AgentDoG 1.5 在多样且复杂的交互式智能体场景中达到最先进性能。所有模型与数据集均已开放发布。
