RLVR Self-Consistency Causal Inference Reasoning
摘要

本文指出,基于可验证奖励的强化学习(RLVR)即使在奖励信号虚假时也能提升推理能力。作者证明常用评估指标存在系统性偏差,混淆了“自我一致性激发”与真实的“奖励设计”效应。通过理论推导与受控实验,论文提出了精确的因果分解框架,量化了两者贡献。重审现有研究发现,部分成果主要由自我一致性主导而非奖励设计。该研究为对齐领域提供了重要的诊断工具与方法论。

AI 推荐理由

论文核心研究 RLVR 如何通过自我一致性提升推理能力,并解耦其机制。

研究机构
未提供具体单位
论文信息
作者 Yuze Gao
发布日期 2026-06-04
arXiv ID 2606.05932
相关性评分 9/10 (高度相关)