Physical Reasoning Reinforcement Learning Sim-to-Real Synthetic Data Physics Olympiad
摘要

针对大语言模型在物理领域缺乏大规模问答数据以训练推理能力的瓶颈,本文提出利用物理模拟器作为监督信号来源。通过在物理引擎中生成随机场景及合成问答对,并采用强化学习进行训练,模型在无需真实数据微调的情况下,实现了向现实世界物理基准的零样本迁移。实验表明,仅使用合成模拟数据训练即可将国际物理奥林匹克竞赛问题的解决率提升 5-10 个百分点,证明了模拟器作为可扩展数据生成器在增强 LLM 深度物理推理技能方面的有效性。

AI 推荐理由

论文核心在于利用物理模拟器训练 LLM 的物理推理能力,直接解决推理数据稀缺问题。

研究机构
Carnegie Mellon University Lambada
论文信息
作者 Mihir Prabhudesai, Aryan Satpathy, Yangmin Li, Zheyang Qin, Nikash Bhardwaj et al.
发布日期 2026-04-13
arXiv ID 2604.11805
相关性评分 9/10 (高度相关)