论文

无用但安全?通过多轮对话中的用户意图澄清对实用程序恢复进行基准测试

Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations

模型评测安全与风险评测

摘要

当前的 LLM 安全对齐技术提高了模型针对对抗性攻击的鲁棒性,但忽略了当良性用户澄清其意图时 LLM 是否以及如何恢复有用性。我们推出了 CarryOnBench,这是第一个交互式基准测试,用于衡量 LLM 是否可以修改对用户意图的解释并恢复实用性,同时通过多轮对话保持安全。从具有良性潜在意图的 398 个看似有害的查询开始,我们通过不同的用户后续序列模拟 5,970 个对话,评估 14 个模型的意图一致实用性和安全性。 CarryOnBench 产生 1,866 个不同的 4--12 轮对话流,总共 23,880 个模型响应。我们设计了 Ben-Util,一个基于清单的指标,用于评估每个模型响应使用原子项目满足用户良性信息需求的程度。在第一个回合,模型仅满足用户良性信息需求的 10.5--37.6%。当相同的查询预先包含良性意图时,模型满足 25.1--72.1%,确认模型由于意图误解而不是有限的知识而保留信息。通过多轮对话中的良性澄清,14 个模型中有 13 个接近或超过了这一单轮基线,但恢复成本因模型而异。我们确定了单轮评估不可见的两种故障模式——不安全恢复(模型以不成比例的安全成本进行更新)和冗余恢复(模型回收先前的响应而不是提供新信息)。此外,无论模型开始时多么保守,对话都会收敛到相似的危害水平。这些发现揭示了单轮评估所遗漏的一个差距——模型是否适当谨慎,或者只是对明确的用户意图没有反应。