摘要
多模态大语言模型在视觉推理方面取得进展,但纯文本思维链仍是细粒度聚焦或视图变换问题的瓶颈。现有“用图像思考”方法受限于固定工具包或生成噪声中间图像。本文提出 ETCHR,将专用图像编辑模型与理解模型解耦。针对语言侧映射抽象问题及生成侧编辑正确性随推理深度下降的差距,采用两阶段训练:基于编辑轨迹的监督微调进行推理模仿,随后利用 VLM 衍生奖励进行推理增强。该方法无需训练即可插件式集成至不同 MLLM,在五项任务家族中显著提升了 Pass@1 指标。
AI 推荐理由
论文核心在于通过图像编辑辅助多模态推理,直接解决细粒度视觉推理瓶颈,显著提升推理准确率。
研究机构
上海人工智能实验室
论文信息