论文
ARMOR 2025:在民用场景之外评估大语言模型安全的军事对齐基准
ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts
摘要
大语言模型(LLM)目前正被探索用于需要可靠且合规决策支持的国防应用。它们在军事场景中增强决策、协同与作战效率方面也具有重要潜力。这些用途要求评估方法能够反映指导真实军事行动的条令标准。现有安全基准聚焦于一般社会风险,并不检验模型是否遵循管辖真实军事行动的法律与伦理规则。为填补这一空白,我们提出ARMOR 2025,一个军事对齐的安全基准,其建立在三大核心军事条令之上:战争法(Law of War)、交战规则(Rules of Engagement)和联合伦理条例(Joint Ethics Regulation)。我们从这些来源中提取条令文本,并生成保留每条规则原意的多项选择题。该基准通过借鉴观察-判断-决策-行动(OODA)决策框架的分类体系进行组织。这一结构支持跨军事相关决策类型系统性地测试准确率与拒答行为。该基准具有结构化的12类分类体系、519个基于条令的提示,以及对21个商用LLM实施的严格评估流程。评估结果揭示了面向军事应用的安全对齐中的关键缺口。
