摘要
本文提出 ContextRL 框架,利用上下文增强技术突破现有瓶颈。为提升可识别性,向奖励模型提供完整参考解作为上下文,实现细粒度过程验证以过滤伪阳性样本。为改善可达性,引入多轮采样策略,由奖励模型生成错误报告指导策略从失败中恢复。在 11 个感知与推理基准上的实验表明,该方法显著提升了知识发现效率,使小模型性能媲美大模型,并有效缓解奖励黑客问题。
AI 推荐理由
论文核心在于通过上下文增强 RL 提升多模态模型的推理过程质量与知识发现效率。
研究机构
清华大学深圳国际研究生院
哈尔滨工业大学(深圳)
中国科学院大学
清华大学
北京航空航天大学
论文信息