摘要
近期视觉语言模型(VLM)虽借助强化学习提升了推理能力,但仍面临缺乏低级视觉信息及有效视觉反馈的局限。为此,本文提出统一的多模态交错推理框架 ForeSight,旨在通过低级视觉线索让模型“看得更远”,并利用有效的视觉反馈使其“想得更深”。该框架首先引入低级视觉工具,将关键视觉信息融入推理链,缓解对细粒度特征的忽视;其次,设计基于掩码的视觉反馈机制,将视觉反思纳入思维过程,使模型能动态重审并更新答案。在强化学习驱动下,ForeSight 学会自主决定工具调用与答案验证。实验表明,ForeSight-7B 在同参数量模型中表现显著优异,部分指标甚至超越当前最先进的闭源模型。
AI 推荐理由
论文核心提出利用低级视觉线索和反思机制增强 VLM 推理能力的框架,直接针对推理短板。
研究机构
百度公司
浙江大学
哈尔滨工业大学
论文信息