论文

ShipTraj-R1:通过组相对策略优化强化大语言模型的船舶轨迹预测

ShipTraj-R1: Reinforcing Ship Trajectory Prediction in Large Language Models via Group Relative Policy Optimization

模型训练强化学习RLVR

摘要

强化微调的最新进展显著提升了大语言模型(LLM)的推理能力。其中组相对策略优化(GRPO)等方法在多个领域展现强大能力。然而,把 LLM 应用于船舶轨迹预测仍基本未被探索。本文提出 ShipTraj-R1,一个新颖的基于 LLM 的框架,把船舶轨迹预测重构为文本到文本生成问题。(1)我们设计包含冲突船舶轨迹信息的动态提示,引导模型实现自适应思维链(CoT)推理。(2)我们引入综合的基于规则的奖励机制,激励模型的推理格式与预测精度。(3)ShipTraj-R1 经由领域专属提示与奖励引导的 GRPO 机制强化,并采用 Qwen3 作为模型骨干。在两个复杂真实海事数据集上的大量实验结果表明,所提 ShipTraj-R1 相较最先进的深度学习与 LLM 基线取得最小误差。

ShipTraj-R1:通过组相对策略优化强化大语言模型的船舶轨迹预测
图1:我们提出的ShipTraj-R1框架概览。