摘要
情境对话要求维护共享上下文的可靠表征,而非仅推理孤立话语。现有代理常因将细粒度区别压缩为纯文本而导致“表征模糊”,无法持久跟踪共享语境。受人类心理意象启发,本文提出一种主动视觉支架框架,将对话状态增量转化为可检索的持久视觉历史。IndiRef 基准评估表明,该混合多模态方法通过减少表征模糊并强制具体场景承诺,显著提升了 grounded 响应生成性能。
AI 推荐理由
论文提出视觉支架框架以构建持久对话历史,解决长期上下文跟踪与表征模糊问题,核心在于记忆机制。
研究机构
Inria
University of Trento
Carnegie Mellon University
论文信息