摘要
大型多模态模型虽具视觉感知力,但受限于静态参数知识。本文突破现有范式,从零构建多模态智能搜索模型。主要贡献包括:提出“智能种子化”阶段以激发智能行为;发现长程交互中历史数据过载导致证据检索困难的瓶颈,并提出 V-Fold 自适应历史压缩方案,通过渲染将历史信息折叠至视觉空间;最终开发出 POINTS-Seeker-8B 模型,在六个基准测试中表现优异,有效解决了长程、知识密集型的视觉推理挑战。
AI 推荐理由
论文核心提出 V-Fold 机制,解决长程交互中历史上下文过载问题,属于记忆架构创新。
研究机构
中国科学院自动化研究所
论文信息