论文
SAFARI:大语言模型辅助危害分析和风险评估的行业基准
SAFARI: An Industrial Benchmark for LLM-Assisted Hazard Analysis and Risk Assessment
摘要
大型语言模型 (LLM) 越来越多地被考虑用于安全关键型工程,但它们在受监管的功能安全工作流程中的可靠性仍未得到充分探索。我们推出 SAFARI(安全意识功能性汽车风险推断),这是 ISO 26262 下 LLM 辅助汽车危害分析和风险评估 (HARA) 的第一个工业基准。它包含 3,000 个去识别化的工业 HARA 案例,并评估两个耦合任务:开放式危害分析和基于标准的风险评估。为了评估开放式 HARA 工件,我们提出了第一个具有高度专家相关性的参考锚定大语言模型作为法官协议。对九个前沿大语言模型的实验表明,模型通常会产生看似合理的危险叙述,但在 ISO 26262 风险分类方面仍然较弱,最好的 ASIL 宏观 F1 仅达到 0.261。思路链提示的好处有限,而且常常会降低分类风险评估的效果。错误分析进一步将重大故障定位到危险产生过程中场景关键上下文的遗漏和风险评估过程中的可控性误判,表明专家监督应该集中在哪里。数据集可以从https://github.com/xixi47520-hash/HARA获取。