visual reasoning data auditing physics QA reinforcement learning
摘要

本文端到端审计多模态物理评估流程,揭示训练污染、翻译漂移及选择题饱和三大问题。通过三阶段审计发现大量近重复数据,并证实语言版本与题型格式显著影响模型表现。为此,作者发布经严格审计的多模态语料库、强化学习池及高难度奥林匹克评测集,并提出基于 Qwen3-VL 的 Physics-R1 训练方案。实验表明,该方法在多个物理推理基准上显著提升模型性能,缩小了与顶尖闭源模型的差距。

AI 推荐理由

论文核心聚焦视觉物理推理,提出审计流程与强化学习方案以提升推理能力。

研究机构
Independent Researcher
论文信息
作者 Shan Yang
发布日期 2026-05-13
arXiv ID 2605.14040
相关性评分 9/10 (高度相关)