多模态代理 强化学习 深度推理 奖励建模
摘要

针对代理多模态模型常因终端奖励局限及上下文冗余导致交互过早崩溃的问题,本文提出 DR-MMSearchAgent 框架。该框架利用结构邻近性从整批轨迹中提取优势信号,鼓励生成长度各异的探索性轨迹;同时采用微分高斯奖励动态校准交互容错率,确保信息可靠性并减少冗余。此外,构建了包含 3602 个高质量多步推理问答对的数据集以支持多轮交互训练。实验表明,该方法在 FVQA-test 上优于 MMSearch-R1 达 8.4%,实现了最先进性能。

AI 推荐理由

论文核心在于通过新奖励机制和数据集深化多模态搜索代理的推理能力,解决交互崩溃问题。

研究机构
1 2,3 4 5
论文信息
作者 Shengqin Wang, Wentao Yan, Huichi Zhou, Yihang Chen, Kun Shao et al.
发布日期 2026-04-21
arXiv ID 2604.19264
相关性评分 9/10 (高度相关)