摘要
视觉 - 语言模型(VLM)在机器人任务中表现优异,但受限于大语言模型的固有缺陷,难以处理物体检测与状态定位中的数值推理问题。为此,本文提出一种新颖的训练策略,利用框解码器输出计算辅助回归损失(ARL)进行微调,同时保留推理时的序列预测能力。基于此策略开发的 StateVLM 模型,能够感知并学习细粒度的物体表示,包括精确的物体及其状态定位和可抓取区域。此外,本文构建了包含 1172 个场景的开源基准 OSAR 以评估物体状态供能推理。实验表明,引入 ARL 显著提升了模型在多个基准上的性能及推理一致性。
AI 推荐理由
论文核心解决 VLM 在机器人任务中的数值推理缺陷,提出新策略提升物体状态定位与供能推理能力。
研究机构
Knowledge Technology Group, Department of Informatics, University of Hamburg, 20146 Hamburg, Germany
King Abdullah University of Science and Technology, 23955, Saudi Arabia
论文信息