Ship Trajectory Prediction GRPO Chain-of-Thought Reinforcement Learning Maritime AI
摘要

近期强化微调显著提升了大语言模型的推理能力,其中群组相对策略优化(GRPO)表现优异。然而,将大语言模型应用于船舶轨迹预测尚属空白。本文提出 ShipTraj-R1,一种基于大语言模型的新框架,将该任务重构为文本生成问题。首先,设计包含冲突船舶信息的动态提示,引导模型实现自适应思维链推理;其次,引入全面的基于规则的奖励机制,激励正确的推理格式与预测精度;最后,利用特定领域提示和奖励,通过 GRPO 机制对 Qwen3 基座模型进行强化。在两个真实海事数据集上的实验表明,该方法误差最低,优于现有最先进基准。

AI 推荐理由

论文核心在于利用 GRPO 强化 LLM 的自适应思维链推理能力,以解决船舶轨迹预测问题。

研究机构
西北工业大学光电与智能研究院(iOPEN) 香港理工大学物流及航运学系 香港理工大学信息工程学系
论文信息
作者 Yang Zhan, Yunhao Li, Zhang Chao, Yuxu Lu, Yan Li
发布日期 2026-03-03
arXiv ID 2603.02939
相关性评分 9/10 (高度相关)