Multimodal Reasoning RLVR Modality Transfer Physics Reasoning Benchmark
摘要

本文提出 SeePhys Pro,一个细粒度模态迁移基准,旨在研究当关键信息从文本逐步转移至图像时,模型是否保持相同的推理能力。评估显示,当前前沿模型并非表示不变的推理者:随着信息从语言转向图表,性能平均下降,视觉变量 grounding 是主要瓶颈。针对此推理脆弱性,作者开发了多模态 RLVR 大规模训练语料,并利用盲训练作为诊断控制,发现即使屏蔽所有训练图像,RL 仍能提升未屏蔽验证集性能。分析表明,这种增益源于残存文本和分布线索而非有效视觉证据,强调了需通过模态迁移鲁棒性及视觉证据依赖性来评估多模态推理。

AI 推荐理由

论文核心研究多模态物理推理能力,评估模态转移下的推理鲁棒性及视觉证据依赖。

研究机构
中山大学 ETH Zurich 华为技术有限公司
论文信息
作者 Kun Xiang, Terry Jingchen Zhang, Zirong Liu, Bokai Zhou, Yueling Tang et al.
发布日期 2026-05-10
arXiv ID 2605.09266
相关性评分 9/10 (高度相关)