VLM Robotics Test-Time Learning Physical Reasoning
摘要

可靠的物体操作需理解随环境变化的物理属性。视觉语言模型(VLM)虽能通用推理,却难以预测特定场景下的物理行为。本文提出 PhysMem,一种使 VLM 机器人规划器无需更新参数即可在测试时通过交互学习物理原理的记忆框架。该系统记录经验、生成假设并通过针对性交互验证,随后将已验证知识用于指导未来决策。其核心设计是“先验证后应用”,即在应用前针对新观测测试假设,减少了对过往经验的僵化依赖。实验表明,该方法在真实操作任务及仿真基准中均显著优于直接经验检索。

AI 推荐理由

论文提出 PhysMem 记忆框架,核心在于测试时通过交互构建和验证记忆以指导规划。

研究机构
斯坦福大学 加州大学圣迭戈分校
论文信息
作者 Haoyang Li, Yang You, Hao Su, Leonidas Guibas
发布日期 2026-02-23
arXiv ID 2602.20323
相关性评分 9/10 (高度相关)