摘要
本文探讨利用硬性及可验证奖励的强化学习(RLVR)能否教会紧凑语言模型进行物理推理。研究在梁静力学问题上训练了 1.5B 参数模型,仅使用符号求解器提供的二元正确性奖励,无需教师生成的推理轨迹。结果显示,最佳模型 Pass@1 提升 66.7%,但其能力呈现各向异性:虽能泛化至更多载荷,却在拓扑结构变化下失效。研究发现,仅靠精确奖励信号会导致模型学习程序化解题模板而非内化控制方程,表明可验证奖励需结合结构化推理支架以实现鲁棒的科学推理。
AI 推荐理由
论文核心研究利用 RL 提升紧凑模型在物理力学中的结构化推理能力,深入分析推理泛化性。
研究机构
麻省理工学院机械工程系,美国马萨诸塞州剑桥
麻省理工学院土木与环境工程系
麻省理工学院计算科学与工程中心,美国马萨诸塞州剑桥
论文信息