摘要
视觉推理模型虽具备强大的跨模态能力,但常因“推理路径冗余”导致过度思考,生成不必要的长推理链。为此,本文提出自适应视觉推理框架(AVR),将视觉推理分解为感知、逻辑推理与答案应用三个认知功能,并支持模型在完整格式、仅感知格式和直接回答三种响应模式中动态选择。通过改进的群相对策略优化算法(FS-GRPO)训练,AVR 在保持准确率的同时,使令牌用量减少 50%-90%,有效缓解了视觉语言模型中的过度思考问题。
AI 推荐理由
论文核心提出自适应视觉推理框架,动态选择推理路径以解决冗余问题,直接优化推理机制。
研究机构
Fudan University
University of California, Davis
论文信息