RLVR 多模态推理 可控探索 混合策略
摘要

针对多模态大语言模型在可验证奖励强化学习(RLVR)训练中因状态空间巨大和奖励稀疏导致的熵崩溃及策略退化问题,本文提出 CalibRL 框架。该框架引入分布感知优势加权以校准分布并保留探索性,同时利用非对称激活函数结合专家知识作为基准,抑制过度自信的更新。实验表明,该方法有效缓解了策略与专家轨迹间的分布失配,在八个基准测试中显著提升了模型的推理性能,实现了探索与利用的稳定平衡。

AI 推荐理由

论文核心旨在通过混合策略 RLVR 提升多模态大模型的推理能力,解决训练中的探索难题。

研究机构
阿里云人工智能研究院 中国电信人工智能研究院 清华大学
论文信息
作者 Zhuoxu Huang, Mengxi Jia, Hao Sun, Xuelong Li, Jungong Han
发布日期 2026-02-22
arXiv ID 2602.20197
相关性评分 9/10 (高度相关)