Common Ground Visual Scaffolding Situated Dialogue Multimodal Memory
摘要

情境对话要求维护共享上下文的可靠表征,而非仅推理孤立话语。现有代理常因将细粒度区别压缩为纯文本而导致“表征模糊”,无法持久跟踪共享语境。受人类心理意象启发,本文提出一种主动视觉支架框架,将对话状态增量转化为可检索的持久视觉历史。IndiRef 基准评估表明,该混合多模态方法通过减少表征模糊并强制具体场景承诺,显著提升了 grounded 响应生成性能。

AI 推荐理由

论文提出视觉支架框架以构建持久对话历史,解决长期上下文跟踪与表征模糊问题,核心在于记忆机制。

研究机构
Inria University of Trento Carnegie Mellon University
论文信息
作者 Biswesh Mohapatra, Giovanni Duca, Laurent Romary, Justine Cassell
发布日期 2026-04-22
arXiv ID 2604.21144
相关性评分 9/10 (高度相关)