摘要
针对视觉语言模型在强化学习中因部分可观测性和分布偏移导致策略利用感知错误的问题,本文提出 SOLE-R1。该模型专为在线强化学习设计,仅凭原始视频和自然语言目标,执行逐帧时空思维链推理,生成密集的任务进度估计作为唯一奖励信号。通过大规模视频轨迹与推理合成管道训练,结合监督微调与可验证奖励的强化学习,SOLE-R1 在四个仿真环境及真实机器人场景中实现了从零样本随机初始化的在线学习,显著优于现有模型并具备更强的抗奖励黑客能力。
AI 推荐理由
论文核心提出基于视频语言推理的奖励机制,利用时空思维链解决机器人学习问题。
研究机构
MIT
RAI Institute
论文信息