3D Vision Affordance Grounding Memory Architecture Vision-Language Models Scene Graph
摘要

功能可供性接地不仅需识别物体,更需定位具体交互区域。针对无训练视觉 - 语言管道在处理微小、模糊及重复区域时的困难,本文提出 AFFORDMEM 框架。该框架通过两级记忆机制实现 3D 功能接地:一是跨场景可供性记忆,利用类别级图像记忆库召回典型示例以引导模型定位;二是场景内空间记忆,构建结构化场景图以解析复杂空间关系引用。该方法无需微调或目标场景标注,在 SceneFun3D 数据集上显著提升了现有无训练方法的性能。

AI 推荐理由

论文核心提出跨场景与场景内双重记忆架构,解决 3D 功能定位难题。

研究机构
TUM A*STAR
论文信息
作者 Qirui Wang, Jingyi He, Yining Pan, Xulei Yang, Shijie Li
发布日期 2026-05-12
arXiv ID 2605.11616
相关性评分 9/10 (高度相关)