摘要
针对现有数字人生成系统依赖被动动画或脚本控制的问题,本文提出视觉接地人形智能体框架。该框架采用双层范式:世界层从视频重建富含语义的 3D 高斯场景;智能体层赋予虚拟人第一人称感知能力,使其具备空间意识与迭代推理能力,从而执行精确的具身规划并驱动全身动作。实验表明,该方法在多样化环境中实现了鲁棒的自主行为,任务成功率更高且碰撞更少,推动了以人为中心的具身人工智能发展。
AI 推荐理由
论文核心提出具身智能体在 3D 场景中的空间感知与迭代推理规划能力,实现目标导向行为。
研究机构
Peking University
Carnegie Mellon University
University of California, Los Angeles
Tongji University
论文信息