Visual Reasoning Reinforcement Learning Token Selection Multimodal AI
摘要

虽然令牌级熵在文本强化学习中能有效进行信用分配,但在视觉推理中该机制因忽略低熵视觉敏感令牌而失效。现有方法难以平衡精确感知 grounding 与语义推理。为此,本文提出 VEPO 框架,通过原则性乘法耦合整合视觉敏感性与令牌熵,将梯度信用重定向至兼具视觉 grounding 和高信息量的令牌。实验表明,VEPO 在 7B 和 3B 模型上显著优于仅基于熵的基线,分别提升 2.28 和 3.15 分,消融实验进一步验证了方法的有效性。

AI 推荐理由

论文核心解决视觉推理中的强化学习信用分配问题,提出新机制显著提升推理性能。

研究机构
福州大学计算机科学与人工智能学院
论文信息
作者 Senjie Jin, Peixin Wang, Boyang Liu, Xiaoran Fan, Shuo Li et al.
发布日期 2026-06-02
arXiv ID 2606.03937
相关性评分 9/10 (高度相关)