摘要
针对视觉语言模型(VLM)在物理基准测试中表现不足的问题,本文系统研究了基于 GRPO 训练的奖励设计对物理推理的影响。研究对比了四种不同语义丰富度的奖励信号,包括格式合规性、答案准确性、复合评分标准及基于注意力权重的内部奖励。实验表明,基于准确性的奖励整体提升最显著,而基于注意力的奖励虽提升了空间推理能力,却在符号领域表现下降。该研究揭示了奖励设计如何诱导特定领域的推理行为,为视觉接地物理推理提供了新方向。
AI 推荐理由
论文核心研究视觉语言模型的物理推理能力,通过奖励设计优化多步符号推断。
研究机构
Pacific Northwest National Laboratory
论文信息