scientific reasoning reinforcement learning physics-consistent RLVR
摘要

大型语言模型在通用推理中表现优异,但在量子力学等需严格遵循物理约束的科学领域可靠性不足。为此,本文提出 QuantumQA 数据集,结合确定性求解器与语义审计确保科学严谨性。在此基础上,设计了面向可验证奖励强化学习(RLVR)的验证感知奖励模型(VRM),利用自适应奖励融合机制动态整合科学执行套件信号与多维语义评估。实验表明,该方法显著优于基线,优化后的 8B 模型性能媲美专有模型,证明了引入基于规则的反馈是参数高效的替代方案。

AI 推荐理由

论文核心在于通过物理一致性数据和验证感知强化学习提升科学推理能力。

研究机构
advanced Technology, University of Science and Technology of China Institute of Advanced Technology, University of Science and Technology of China
论文信息
作者 Songxin Qu, Tai-Ping Sun, Yun-Jie Wang, Huan-Yu Liu, Cheng Xue et al.
发布日期 2026-04-20
arXiv ID 2604.18176
相关性评分 9/10 (高度相关)