论文

DriveSafe:面向安全攸关的 LLM 驾驶助手分层风险分类体系

DriveSafe: A Hierarchical Risk Taxonomy for Safety-Critical LLM-Based Driving Assistants

模型评测安全与风险评测

摘要

大语言模型(LLM)日益被集成到车载数字助手中,其中不安全、含糊或法律上错误的回答可能引发严重的安全、伦理与监管后果。尽管 LLM 安全日益受到关注,现有分类体系与评估框架大多仍是通用型的,未能捕捉真实驾驶场景固有的领域特定风险。本文提出 DriveSafe,一个分层的四层风险分类体系,用于系统刻画基于 LLM 的驾驶助手的安全攸关失效模式。该分类体系包含 129 个细粒度原子风险类别,覆盖技术、法律、社会与伦理维度,植根于真实驾驶法规与安全原则并经领域专家评审。为验证所构建提示的安全相关性与现实性,我们在六个广泛部署的 LLM 上评估其拒绝行为。我们的分析表明,被评估模型常常未能恰当拒绝不安全或违规的驾驶相关查询,凸显了通用安全对齐在驾驶语境中的局限。