Embodied AI Vision-Language-Action Self-Evolving Robotics
摘要

本文推出 HY-Embodied-0.5,专为现实世界具身智能体设计的基础模型系列。该模型旨在弥合通用视觉语言模型与具身需求间的差距,增强时空视觉感知及高级具身推理(预测、交互与规划)能力。架构上采用混合 Transformer 以支持细粒度感知,并引入迭代式自进化后训练范式提升推理。通过策略蒸馏将大模型能力迁移至小模型。评估显示,其在多个基准测试中表现优异,并能有效驱动下游机器人控制任务。

AI 推荐理由

论文核心在于提升具身智能的空间推理与规划能力,并提出自进化训练范式。

研究机构
腾讯机器人X实验室 & HY视觉团队
论文信息
作者 Tencent Robotics X, HY Vision Team, :, Xumin Yu, Zuyan Liu et al.
发布日期 2026-04-08
arXiv ID 2604.07430
相关性评分 9/10 (高度相关)