摘要
多模态大语言模型(MLLMs)中的 3D 定位受限于相机内参模糊性。现有方法要么忽略相机参数,要么仅将外部工具返回的深度信息作为参考提示,导致相机信息无法确定性传播。本文提出一种方程锚定的工具使用框架,将空间工具重构为公式变量。该框架主动检索相机内参并采样多点度量深度,在思维链中显式写出针孔反投影方程,并将工具输出代入公式以回归最终的 9 自由度边界框。实验表明,该方法在不同相机尺度下显著优于基线。
AI 推荐理由
论文核心提出基于方程锚定的工具使用框架,将空间工具作为公式变量,属于技能学习范畴。
研究机构
Nanyang Technological University
Alibaba Group
论文信息