Multimodal Agent Reinforcement Learning Visual Reasoning Process-Oriented Reward
摘要

针对知识密集型视觉推理中基于结果的监督极度稀疏及实时网络环境不可预测的问题,本文提出了 ProMMSearchAgent。该研究建立了一种新颖的多模态搜索“模拟到真实”训练范式,将策略学习解耦至确定的本地静态沙箱中。核心创新在于提出了一种内省式的面向过程奖励机制,通过探测智能体自身的参数知识边界生成密集的行为元数据,仅在视觉或事实不确定时触发搜索。实验表明,该本地训练策略可零样本迁移至实时 Google 搜索 API,并在多个基准测试中取得最先进性能。

AI 推荐理由

论文核心解决视觉推理中的稀疏奖励问题,提出面向过程的奖励机制以优化认知决策。

研究机构
东北师范大学 上海创新研究院 华为诺亚方舟实验室 独立研究员
论文信息
作者 Wentao Yan, Shengqin Wang, Huichi Zhou, Yihang Chen, Kun Shao et al.
发布日期 2026-04-22
arXiv ID 2604.20486
相关性评分 9/10 (高度相关)