论文
相同请求,不同边界:跨对话情境评估网络安全辅助
Same Request, Different Boundary: Evaluating Cybersecurity Assistance across Conversational Contexts
摘要
大语言模型(LLM)可以解决复杂的问题,但在高风险领域滥用它们可能会导致严重的后果。因此,模型提供者限制对潜在有害请求的协助。因此,拒绝所有网络安全请求将会损害合法用户。提供商需要一种机制来阻止恶意使用,同时又不拒绝向防御者提供合法援助。现有的网络安全特定数据集评估了这种机制,但没有一个数据集考虑请求的会话上下文。我们引入了 3R-Bench(拒绝、重复和修订),这是一个由 150 个现实世界网络安全请求组成的基准,并通过两种对抗性对话设置进行了增强,并在此基础上评估了 8 个LLM。先前的助理行为会极大地改变对未更改请求的响应:在 400 对面板中的 376 个可用对中,遵从性从拒绝历史记录后的 62.0% 上升到接受历史记录后的 85.1%。相反的模式出现在对话分解下。相比之下,遵守率从直接回应的 501/800 下降到对话后的 172/800;在这两种情况下返回模型创作文本的 738 对中,下降了 45.1 分。故障反馈只能弥补这种损失的一小部分。