论文

评估大语言模型在国际海运危险货物规则合规上的表现

Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance

模型评测基准与评测资源

摘要

海运危险货物运输是一项由《国际海运危险货物(IMDG)规则》管辖的高后果活动,这是一个复杂的监管框架,分类、包装、积载或隔离上的错误可能引发火灾、爆炸、有毒泄漏或人员与船舶损失。正确的合规需要准确解释数百页相互作用的条款,且条款按两年修订周期更新。从业者越来越多地把大语言模型(LLM)用作决策支持工具,但尚无系统评估检验它们能否可靠地解释IMDG要求以用于安全关键场景。本文提出DGEval,首个评估LLM对IMDG第42-24修正案知识的基准。它基于NCB Hazcheck在线学习平台上专家撰写的题目和《危险货物一览表》(DGL)的结构化查询构建,包含1,678道题,覆盖选择题、开放式题、DGL查询和法规识别任务。我们评估了来自六个提供商的13个模型的多种思考配置,包括一个海运领域微调模型,并测试了网络搜索的影响。尽管表现最好的模型在选择题上超过人类从业者基线,所有模型都在积载、隔离和法规条文召回这些操作上安全关键的领域最弱。这些结果表明,LLM可以支持合规任务,尤其是配合网络搜索的结构化DGL查询,但操作领域和法规文本召回的不可靠意味着在任何安全关键场景部署之前,人工监督和权威来源核验仍然必要。DGEval被设计为随模型演进而持续应用的安全保障工具,而非对当前能力的最终定论。