摘要
“借助图像思考”虽能提升细粒度视觉推理能力,但存在工具调用冗余和推理轨迹过长的问题。本文提出“借助想象思考”,旨在不实际调用工具的情况下,内部决定观察位置并构想视觉线索。我们设计了 Imagine-OPD 框架,利用在线策略自蒸馏技术,让教师模型在训练中扮演“借助图像思考”的角色,利用特权缩放证据监督模型的想象推理轨迹。实验表明,该方法在降低推理开销的同时,在视觉基准测试中取得了最优平均性能。
AI 推荐理由
论文核心研究视觉推理机制,提出通过内部想象内化外部工具辅助的推理过程。
研究机构
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University
Central South University
University of Science and Technology of China
论文信息