摘要
本文提出 SeePhys Pro,一个细粒度模态迁移基准,旨在研究当关键信息从文本逐步转移至图像时,模型是否保持相同的推理能力。评估显示,当前前沿模型并非表示不变的推理者:随着信息从语言转向图表,性能平均下降,视觉变量 grounding 是主要瓶颈。针对此推理脆弱性,作者开发了多模态 RLVR 大规模训练语料,并利用盲训练作为诊断控制,发现即使屏蔽所有训练图像,RL 仍能提升未屏蔽验证集性能。分析表明,这种增益源于残存文本和分布线索而非有效视觉证据,强调了需通过模态迁移鲁棒性及视觉证据依赖性来评估多模态推理。
AI 推荐理由
论文核心研究多模态物理推理能力,评估模态转移下的推理鲁棒性及视觉证据依赖。
研究机构
中山大学
ETH Zurich
华为技术有限公司
论文信息