摘要
近期多模态大语言模型虽支持通过调用视觉工具进行“图像思维”,但在细粒度视觉推理中仍显脆弱,因其需在获取证据前决定观察位置,形成“接地悖论”。为此,本文提出测试时感知扩展(TTSP)框架,将感知视为可扩展的推理过程。该方法生成多条探索性感知轨迹,利用基于熵的置信度估计过滤不可靠轨迹,将验证后的观察蒸馏为结构化知识,并迭代优化后续探索以解决未决不确定性。实验表明,TTSP 在不同规模基座模型上均显著优于强基线,兼具良好的可扩展性与令牌效率。
AI 推荐理由
论文核心解决多模态细粒度推理中的感知悖论,提出测试时扩展框架以提升推理鲁棒性。
研究机构
清华大学
北京科技大学
论文信息