摘要
本文端到端审计多模态物理评估流程,揭示训练污染、翻译漂移及选择题饱和三大问题。通过三阶段审计发现大量近重复数据,并证实语言版本与题型格式显著影响模型表现。为此,作者发布经严格审计的多模态语料库、强化学习池及高难度奥林匹克评测集,并提出基于 Qwen3-VL 的 Physics-R1 训练方案。实验表明,该方法在多个物理推理基准上显著提升模型性能,缩小了与顶尖闭源模型的差距。
AI 推荐理由
论文核心聚焦视觉物理推理,提出审计流程与强化学习方案以提升推理能力。
研究机构
Independent Researcher
论文信息