摘要
针对现有视频奖励模型在判别式方法易受捷径学习影响、生成式方法因推理与评分耦合导致优化困难的问题,本文提出 DeScore 模型。该模型采用“先思考后评分”的解耦范式:首先由多模态大语言模型生成显式的思维链推理,随后通过专用的判别式评分模块预测最终奖励。通过两阶段训练框架,包括引入随机掩码的判别式冷启动和双目标强化学习,独立优化推理质量并校准奖励,确保高质量推理直接转化为优越的模型性能,显著提升了泛化能力与训练稳定性。
AI 推荐理由
论文核心提出解耦推理与评分的范式,利用思维链提升视频奖励模型的推理质量与泛化能力。
研究机构
University of Science and Technology of China
论文信息