摘要
针对长程机器人操控中过程监督的难题,本文提出 PRIMO R1 框架。该方法利用基于结果的强化学习,将视频多模态大模型从被动“观察者”转化为主动“批评家”,激励其生成显式的思维链以评估任务进度。通过构建锚定初始与当前状态的结构化时序输入,并在多样化场景中实验,该 7B 模型在专用推理基准上误差降低 50%,且在 RoboFail 基准上超越 OpenAI o1 等闭源模型,展现出卓越的零-shot 泛化与故障检测能力。
AI 推荐理由
论文核心是通过强化学习激发显式思维链,提升过程推理与状态评估能力。
研究机构
上海交通大学
东北大学
马来西亚北方大学
香港大学
论文信息