论文

OpenSafeIntent:评估双用提示集的意图校准安全完成

OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets

模型评测基准与评测资源

摘要

安全完成要求模型在不造成损害的情况下提供有用的帮助,但这种行为很难用孤立的提示来评估。我们引入了 OpenSafeIntent,这是受控提示集的基准,它可以在保持底层任务固定的同时改变意图。每个数据点都包含同一任务的良性、双重用途和恶意变体。这种设计让我们能够评估模型是否能够在意图转变时校准帮助,而不仅仅是平均而言显得安全。在广泛的模型套件中,我们发现提示级安全性隐藏了重要的失败:模型通常无法在匹配的意图变体中保持安全,双重用途行为在释义下是脆弱的,关于风险主题的高级答案并不可靠安全,将不明确的请求重新构建为更安全的任务的响应基本上不太可能跨越安全边界。我们的结果表明,安全完成应该被评估为对受控任务变体的意图校准行为,而不是对独立提示的单一安全性与有用性权衡。