摘要
可验证奖励强化学习(RLVR)在逻辑推理中成效显著,但其是否适用于需多样性的道德推理尚不明确。本文在 MoReBench 上首次对比了分布匹配与奖励最大化两种范式。通过构建基于规则的奖励管道,研究发现道德推理的高奖励分布比数学推理更集中,多样性方法并无显著优势。结果表明,标准奖励最大化 RLVR 方法可有效迁移至道德推理,无需显式多样性机制。
AI 推荐理由
论文核心研究道德推理任务中的对齐方法,对比不同 RL 范式在推理场景下的表现。
研究机构
北京大学人工智能研究院
微软研究院
密歇根大学
上海交通大学
清华大学
论文信息