Long-horizon Search Multimodal Memory Context Management Visual Representation
摘要

针对多模态深度搜索智能体在长程任务中面临的异构信息管理与高昂令牌成本挑战,本文提出 LMM-Searcher 框架。该框架核心采用基于文件的视觉表示机制,将视觉资产卸载至外部文件系统并映射为轻量级文本标识符,有效缓解上下文开销同时保留多模态信息。此外,文章设计了定制图像获取工具以实现按需加载策略,并构建数据合成流水线生成了 1.2 万条高质量轨迹用于微调模型。实验表明,该方法在多个基准测试中实现了百轮次搜索的扩展,达到了开源模型的最先进水平。

AI 推荐理由

论文核心提出基于文件的视觉表示机制,解决长程多模态搜索中的上下文爆炸与记忆管理难题。

研究机构
戈登人工智能学院,北京理工大学
论文信息
作者 Yifan Du, Zikang Liu, Jinbiao Peng, Jie Wu, Junyi Li et al.
发布日期 2026-04-14
arXiv ID 2604.12890
相关性评分 9/10 (高度相关)