摘要
点云视觉语言模型旨在赋予具身智能体可执行的空间推理能力,但常因预测的 3D 结构与观测到的 2D 现实矛盾而产生几何幻觉。本文指出该问题源于强化学习中稀疏几何令牌被噪声序列级奖励淹没的结构错位。为此,提出几何奖励信用分配框架,将整体监督解耦为特定领域信号并路由至对应令牌跨度,实现精准梯度更新。此外,引入重投影一致性项作为跨模态验证器以惩罚物理上不可能的几何结构。实验表明,该方法显著提升了 3D 关键点对齐及边界框交并比,同时保持了鲁棒的 2D 定位性能。
AI 推荐理由
论文核心解决 3D 空间推理中的几何幻觉问题,通过奖励分配机制提升推理准确性。
研究机构
西北工业大学
南方科技大学
谢菲尔德大学
鹏城实验室
天津大学
论文信息