Video Reward Modeling Chain-of-Thought Decoupled Learning Multimodal LLM
摘要

针对现有视频奖励模型在判别式方法易受捷径学习影响、生成式方法因推理与评分耦合导致优化困难的问题,本文提出 DeScore 模型。该模型采用“先思考后评分”的解耦范式:首先由多模态大语言模型生成显式的思维链推理,随后通过专用的判别式评分模块预测最终奖励。通过两阶段训练框架,包括引入随机掩码的判别式冷启动和双目标强化学习,独立优化推理质量并校准奖励,确保高质量推理直接转化为优越的模型性能,显著提升了泛化能力与训练稳定性。

AI 推荐理由

论文核心提出解耦推理与评分的范式,利用思维链提升视频奖励模型的推理质量与泛化能力。

研究机构
University of Science and Technology of China
论文信息
作者 Yuan Wang, Ouxiang Li, Yulong Xu, Borui Liao, Jiajun Liang et al.
发布日期 2026-05-07
arXiv ID 2605.05922
相关性评分 9/10 (高度相关)