RLVR Moral Reasoning LLM Alignment Diversity
摘要

可验证奖励强化学习(RLVR)在逻辑推理中成效显著,但其是否适用于需多样性的道德推理尚不明确。本文在 MoReBench 上首次对比了分布匹配与奖励最大化两种范式。通过构建基于规则的奖励管道,研究发现道德推理的高奖励分布比数学推理更集中,多样性方法并无显著优势。结果表明,标准奖励最大化 RLVR 方法可有效迁移至道德推理,无需显式多样性机制。

AI 推荐理由

论文核心研究道德推理任务中的对齐方法,对比不同 RL 范式在推理场景下的表现。

研究机构
北京大学人工智能研究院 微软研究院 密歇根大学 上海交通大学 清华大学
论文信息
作者 Zhaowei Zhang, Xiaohan Liu, Xuekai Zhu, Junchao Huang, Ceyao Zhang et al.
发布日期 2026-03-11
arXiv ID 2603.10588
相关性评分 9/10 (高度相关)