Multimodal LLM Reinforcement Learning Visual Reasoning Agent Framework
摘要

针对多模态大语言模型在复杂场景中图像解释准确率低的问题,本文提出 Mags-RL 框架。该方法利用代理强化学习,赋予模型外部超分辨率“放大镜”代理,实现高分辨率细粒度检查。模型执行两轮推理:首轮自主识别感兴趣区域,次轮调用代理裁剪并放大这些区域以验证和修正推理。此外,引入课程学习策略,仅需少量样本即可高效训练。实验表明,该方法在多个基准测试中优于现有方法,实现了高质量的视觉 grounding 推理。

AI 推荐理由

论文核心解决复杂场景下的多模态推理难题,通过代理机制提升细粒度视觉推理能力。

研究机构
Arizona State University, Tempe, AZ, USA Clemson University, Clemson, SC, USA
论文信息
作者 Xuanzhao Dong, Wenhui Zhu, Peijie Qiu, Xiwen Chen, Xiaobing Yu et al.
发布日期 2026-05-27
arXiv ID 2605.27960
相关性评分 9/10 (高度相关)