Reinforcement Learning Multimodal LLM Reasoning Reward Hacking
摘要

本文提出 ContextRL 框架,利用上下文增强技术突破现有瓶颈。为提升可识别性,向奖励模型提供完整参考解作为上下文,实现细粒度过程验证以过滤伪阳性样本。为改善可达性,引入多轮采样策略,由奖励模型生成错误报告指导策略从失败中恢复。在 11 个感知与推理基准上的实验表明,该方法显著提升了知识发现效率,使小模型性能媲美大模型,并有效缓解奖励黑客问题。

AI 推荐理由

论文核心在于通过上下文增强 RL 提升多模态模型的推理过程质量与知识发现效率。

研究机构
清华大学深圳国际研究生院 哈尔滨工业大学(深圳) 中国科学院大学 清华大学 北京航空航天大学
论文信息
作者 Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu et al.
发布日期 2026-02-26
arXiv ID 2602.22623
相关性评分 9/10 (高度相关)