论文

探索大语言模型在真实海事航行场景中的态势理解与COLREG合规能力

Exploring LLM Capabilities for Situational Understanding and COLREG compliance on real-world maritime navigation scenarios

模型评测模型能力评测

摘要

近年来,大语言模型(LLM)已在不同领域展现出可观的态势理解、推理与决策能力,其中以汽车领域最为突出。因此,我们探索将当前最先进的LLM用作海事航行工具,其涉及《国际海上避碰规则》(COLREGs)中的成文规则,以及以“良好船艺”(Good Seamanship)概念概括的未成文最佳实践。我们基于AIS数据构建了一个由50个多样化真实航行场景组成的数据集,并为场景标注适用的COLREG规则、推荐动作及采取该动作的推理依据。我们考察了多种不同架构与规模的LLM,以确定其对海事航行任务的理解,并评估其在该领域的推理能力。所得结果表明,不经过微调,海事航行任务仍然难以解决,即便对较大的在线模型也是如此。

探索大语言模型在真实海事航行场景中的态势理解与COLREG合规能力:论文配图
图1:相对于基线的模型相对准确率。