Multimodal LLM Reinforcement Learning Visual Grounding Token Optimization
摘要

将可验证奖励强化学习(RLVR)扩展至多模态大语言模型面临根本挑战:其响应交织着锚定视觉内容的感知 token 与构建推理链的推理 token。这两种 token 实例化了视觉接地与符号推理两种独立却相互依赖的能力,使得孤立优化效果不佳。本文提出即插即用的 Token 重加权(ToR)策略,通过识别关键 token 并在训练中动态重加权,显式建模这种依赖性。实验表明,该方法在多个多模态推理基准上均取得最先进性能,实现了准确的视觉接地与连贯的推理。

AI 推荐理由

论文核心解决多模态推理中感知与推理 token 的耦合优化问题,显著提升推理能力。

研究机构
University of Science and Technology of China
论文信息
作者 Jinda Lu, Junkang Wu, Jinghan Li, Kexin Huang, Shuo Yang et al.
发布日期 2026-03-26
arXiv ID 2603.25077
相关性评分 9/10 (高度相关)