spatial memory embodied AI rendering 3D representation
摘要

具身推理本质上依赖于视角:可见性、遮挡及可达性关键取决于代理所处位置。然而,现有具身代理的空间记忆系统通常存储多视角观测或对象中心抽象,难以进行具有明确几何基础的推理。本文提出 RenderMem,一种将渲染视为 3D 世界表示与空间推理之间接口的空间记忆框架。RenderMem 不存储固定观测,而是维护 3D 场景表示,并通过从查询隐含的视角渲染场景来生成查询条件的视觉证据。这使得具身代理能够直接从任意视角推理视线、可见性和遮挡关系。实验表明,该方法在视角依赖的查询任务上显著优于现有基线。

AI 推荐理由

论文提出 RenderMem 框架,核心创新在于将渲染作为空间记忆检索接口,解决具身智能体的视角依赖记忆问题。

研究机构
韩国大学
论文信息
作者 JooHyun Park, HyeongYeop Kang
发布日期 2026-03-15
arXiv ID 2603.14669
相关性评分 9/10 (高度相关)