摘要
可验证奖励的强化学习(RLVR)显著提升了大语言模型的推理能力。随着模型向原生多模态架构演进,将 RLVR 扩展至视频理解至关重要但仍待探索。本文提出 EasyVideoR1,一个专为视频理解任务设计的高效强化学习框架。其贡献包括:消除冗余解码的全流程视频 RL 训练管道、覆盖 11 种任务类型的感知奖励系统、混合离线 - 在线数据训练范式、支持独立像素预算的图文联合训练,以及涵盖 22 个基准的异步评估框架,有效提升了模型的视频推理性能。
AI 推荐理由
论文核心是通过 RLVR 提升多模态模型的视频理解与推理能力,属于推理增强研究。
研究机构
中国科学院信息工程研究所,北京,中国
清华大学网络空间安全学院,北京,中国
论文信息