Reward Modeling Visual Generation Reasoning Reinforcement Learning
摘要

针对现有视觉生成奖励模型将人类判断简化为单一分数而丢弃底层推理的问题,本文提出让奖励模型在打分前生成显式的多维批评。该方法通过训练时的结构化理由提供细粒度强化学习奖励,并在测试时通过“生成 - 批评 - 优化”循环改进输出。作者提出了偏好锚定合理化框架(PARROT),无需昂贵标注即可从偏好数据中恢复高质量理由。实验表明,该模型在少数据下达到最先进水平,且测试时的推理优化效果可媲美基于强化学习的微调。

AI 推荐理由

论文核心在于利用显式多维推理(critiques)增强奖励模型,通过推理链条优化生成效果。

研究机构
HKUST University of Waterloo Alibaba
论文信息
作者 Haozhe Wang, Cong Wei, Weiming Ren, Jiaming Liu, Fangzhen Lin et al.
发布日期 2026-04-13
arXiv ID 2604.11626
相关性评分 9/10 (高度相关)