论文

开放域安全策略构建

Open-Domain Safety Policy Construction

智能体系统Agent 架构与控制循环

摘要

审核层日益成为许多基于用户或模型生成内容构建的产品的核心组件。然而,起草和维护特定领域的安全策略仍然成本高昂。我们提出了深度策略研究(DPR),这是一个最小的代理系统,它仅基于人类编写的种子域信息起草完整的内容审核策略。 DPR 使用单一网络搜索工具和轻量级脚手架来迭代地提出搜索查询,将不同的网络资源提炼成策略规则,并将规则组织到索引文档中。我们根据 (1) 使用两个紧凑型阅读器 LLM 跨五个领域的 OpenAI 不良内容基准和 (2) 内部多模式广告审核基准来评估 DPR。 DPR 始终优于仅定义和上下文学习基线,并且在我们的端到端设置中,它在多个领域与专家编写的政策部分具有竞争力。此外,在相同的种子规范和评估协议下,DPR 的性能优于通用深度研究系统,这表明针对特定任务的结构化研究循环可以比用于政策起草的通用网络研究更有效。我们在 https://github.com/xiaowu0162/deep-policy-research 发布了我们的实验代码。