Robotics Goal-Conditioned RL Long-Horizon Planning VLA Models
摘要

针对现有视觉 - 语言 - 动作模型忽视机器人学习作为目标达成过程的本质,本文提出 PRTS 系统。该系统通过目标条件强化学习重构预训练,利用对比学习构建统一嵌入空间,量化评估物理可行性而非仅静态语义匹配。PRTS 直接从离线轨迹中获取密集的目标可达性监督,无需奖励标注。实验表明,该方法显著提升了通用机器人在长程、高接触及零样本新指令场景下的执行成功率与规划能力。

AI 推荐理由

论文核心是通过目标可达性感知提升长程任务规划能力,解决多步执行问题。

研究机构
Institute of Artificial Intelligence (TeloAI), China Telecom Fudan University Tsinghua University Shanghai Jiao Tong University
论文信息
作者 Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li et al.
发布日期 2026-04-30
arXiv ID 2604.27472
相关性评分 9/10 (高度相关)