摘要
近期强化微调显著提升了大语言模型的推理能力,其中群组相对策略优化(GRPO)表现优异。然而,将大语言模型应用于船舶轨迹预测尚属空白。本文提出 ShipTraj-R1,一种基于大语言模型的新框架,将该任务重构为文本生成问题。首先,设计包含冲突船舶信息的动态提示,引导模型实现自适应思维链推理;其次,引入全面的基于规则的奖励机制,激励正确的推理格式与预测精度;最后,利用特定领域提示和奖励,通过 GRPO 机制对 Qwen3 基座模型进行强化。在两个真实海事数据集上的实验表明,该方法误差最低,优于现有最先进基准。
AI 推荐理由
论文核心在于利用 GRPO 强化 LLM 的自适应思维链推理能力,以解决船舶轨迹预测问题。
研究机构
西北工业大学光电与智能研究院(iOPEN)
香港理工大学物流及航运学系
香港理工大学信息工程学系
论文信息