摘要
针对多模态大语言模型在复杂场景中图像解释准确率低的问题,本文提出 Mags-RL 框架。该方法利用代理强化学习,赋予模型外部超分辨率“放大镜”代理,实现高分辨率细粒度检查。模型执行两轮推理:首轮自主识别感兴趣区域,次轮调用代理裁剪并放大这些区域以验证和修正推理。此外,引入课程学习策略,仅需少量样本即可高效训练。实验表明,该方法在多个基准测试中优于现有方法,实现了高质量的视觉 grounding 推理。
AI 推荐理由
论文核心解决复杂场景下的多模态推理难题,通过代理机制提升细粒度视觉推理能力。
研究机构
Arizona State University, Tempe, AZ, USA
Clemson University, Clemson, SC, USA
论文信息