Multimodal Reasoning Reinforcement Learning Chain-of-Thought Policy Optimization
摘要

近期多模态大语言模型鼓励在多轮推理中调用视觉工具进行“图像思维”。然而,仅依赖结果奖励的强化学习忽略了文本合理性可能掩盖执行失败的问题,导致推理与行动脱节,累积噪声并削弱推理能力。本文提出多模态智能体策略优化(MAPO),要求模型对工具获取的视觉内容生成明确文本描述,并利用描述与观测的语义对齐结合任务奖励进行优势估计。理论证明该方法降低梯度方差,实验表明其在多个视觉推理基准上性能优越。

AI 推荐理由

论文核心解决多模态推理中思维与行动的不一致,提出 MAPO 优化推理轨迹。

研究机构
国家新一代人工智能创新中心,南京大学,中国
论文信息
作者 Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen et al.
发布日期 2026-04-08
arXiv ID 2604.06777
相关性评分 9/10 (高度相关)