Vision-Language Models Physical Reasoning Reward Design GRPO Attention Mechanism
摘要

针对视觉语言模型(VLM)在物理基准测试中表现不足的问题,本文系统研究了基于 GRPO 训练的奖励设计对物理推理的影响。研究对比了四种不同语义丰富度的奖励信号,包括格式合规性、答案准确性、复合评分标准及基于注意力权重的内部奖励。实验表明,基于准确性的奖励整体提升最显著,而基于注意力的奖励虽提升了空间推理能力,却在符号领域表现下降。该研究揭示了奖励设计如何诱导特定领域的推理行为,为视觉接地物理推理提供了新方向。

AI 推荐理由

论文核心研究视觉语言模型的物理推理能力,通过奖励设计优化多步符号推断。

研究机构
Pacific Northwest National Laboratory
论文信息
作者 Derek Lilienthal, Manisha Mukherjee, Sameera Horawalavithana
发布日期 2026-04-15
arXiv ID 2604.13993
相关性评分 9/10 (高度相关)