多模态智能体 记忆压缩 长程交互 视觉推理 从头训练
摘要

大型多模态模型虽具视觉感知力,但受限于静态参数知识。本文突破现有范式,从零构建多模态智能搜索模型。主要贡献包括:提出“智能种子化”阶段以激发智能行为;发现长程交互中历史数据过载导致证据检索困难的瓶颈,并提出 V-Fold 自适应历史压缩方案,通过渲染将历史信息折叠至视觉空间;最终开发出 POINTS-Seeker-8B 模型,在六个基准测试中表现优异,有效解决了长程、知识密集型的视觉推理挑战。

AI 推荐理由

论文核心提出 V-Fold 机制,解决长程交互中历史上下文过载问题,属于记忆架构创新。

研究机构
中国科学院自动化研究所
论文信息
作者 Yikun Liu, Yuan Liu, Le Tian, Xiao Zhou, Jiangchao Yao et al.
发布日期 2026-04-15
arXiv ID 2604.14029
相关性评分 9/10 (高度相关)