摘要
对齐多模态大语言模型需要可靠的奖励模型,但现有单步评估器常因懒惰判断而失效。为此,本文提出 DeltaRubric,将多模态偏好评估重构为单模型内的“计划 - 执行”过程。该方法首先作为“分歧规划器”生成特定实例的验证清单,随后转为“清单验证器”执行检查以得出 grounded 判断。通过多角色强化学习联合优化规划与验证能力,实验表明其在 VL-RewardBench 上显著提升了基准模型的准确率,证明结构化可验证步骤能增强评估可靠性。
AI 推荐理由
论文核心提出“计划 - 执行”框架,将评估重构为动态生成检查单并验证的规划过程。
研究机构
Tencent Hunyuan
University of Maryland, College Park
University of North Carolina, Chapel Hill
论文信息