摘要
功能可供性接地不仅需识别物体,更需定位具体交互区域。针对无训练视觉 - 语言管道在处理微小、模糊及重复区域时的困难,本文提出 AFFORDMEM 框架。该框架通过两级记忆机制实现 3D 功能接地:一是跨场景可供性记忆,利用类别级图像记忆库召回典型示例以引导模型定位;二是场景内空间记忆,构建结构化场景图以解析复杂空间关系引用。该方法无需微调或目标场景标注,在 SceneFun3D 数据集上显著提升了现有无训练方法的性能。
AI 推荐理由
论文核心提出跨场景与场景内双重记忆架构,解决 3D 功能定位难题。
研究机构
TUM
A*STAR
论文信息