论文

ARMOR 2025:在民用场景之外评估大语言模型安全的军事对齐基准

ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts

模型评测基准与评测资源

摘要

大语言模型(LLM)目前正被探索用于需要可靠且合规决策支持的国防应用。它们在军事场景中增强决策、协同与作战效率方面也具有重要潜力。这些用途要求评估方法能够反映指导真实军事行动的条令标准。现有安全基准聚焦于一般社会风险,并不检验模型是否遵循管辖真实军事行动的法律与伦理规则。为填补这一空白,我们提出ARMOR 2025,一个军事对齐的安全基准,其建立在三大核心军事条令之上:战争法(Law of War)、交战规则(Rules of Engagement)和联合伦理条例(Joint Ethics Regulation)。我们从这些来源中提取条令文本,并生成保留每条规则原意的多项选择题。该基准通过借鉴观察-判断-决策-行动(OODA)决策框架的分类体系进行组织。这一结构支持跨军事相关决策类型系统性地测试准确率与拒答行为。该基准具有结构化的12类分类体系、519个基于条令的提示,以及对21个商用LLM实施的严格评估流程。评估结果揭示了面向军事应用的安全对齐中的关键缺口。

ARMOR 2025:在民用场景之外评估大语言模型安全的军事对齐基准:论文配图
图 1:ARMOR 2025 分类和基准生成工作流程。顶部展示了战场风险的 12 类分类。底部描述了基准生成过程,从学说规则抽象开始,基于LLM的问题起草,自动验证和重复数据删除,以及最终问题集手动审查和构建。