Embodied AI 3D Scene Understanding Autonomous Agents Motion Planning
摘要

针对现有数字人生成系统依赖被动动画或脚本控制的问题,本文提出视觉接地人形智能体框架。该框架采用双层范式:世界层从视频重建富含语义的 3D 高斯场景;智能体层赋予虚拟人第一人称感知能力,使其具备空间意识与迭代推理能力,从而执行精确的具身规划并驱动全身动作。实验表明,该方法在多样化环境中实现了鲁棒的自主行为,任务成功率更高且碰撞更少,推动了以人为中心的具身人工智能发展。

AI 推荐理由

论文核心提出具身智能体在 3D 场景中的空间感知与迭代推理规划能力,实现目标导向行为。

研究机构
Peking University Carnegie Mellon University University of California, Los Angeles Tongji University
论文信息
作者 Hang Ye, Xiaoxuan Ma, Fan Lu, Wayne Wu, Kwan-Yee Lin et al.
发布日期 2026-04-09
arXiv ID 2604.08509
相关性评分 9/10 (高度相关)