Process Reasoning Reinforcement Learning Robotics Chain-of-Thought
摘要

针对长程机器人操控中过程监督的难题,本文提出 PRIMO R1 框架。该方法利用基于结果的强化学习,将视频多模态大模型从被动“观察者”转化为主动“批评家”,激励其生成显式的思维链以评估任务进度。通过构建锚定初始与当前状态的结构化时序输入,并在多样化场景中实验,该 7B 模型在专用推理基准上误差降低 50%,且在 RoboFail 基准上超越 OpenAI o1 等闭源模型,展现出卓越的零-shot 泛化与故障检测能力。

AI 推荐理由

论文核心是通过强化学习激发显式思维链,提升过程推理与状态评估能力。

研究机构
上海交通大学 东北大学 马来西亚北方大学 香港大学
论文信息
作者 Yibin Liu, Yaxing Lyu, Daqi Gao, Zhixuan Liang, Weiliang Tang et al.
发布日期 2026-03-16
arXiv ID 2603.15600
相关性评分 9/10 (高度相关)