Vision-Language Models Visual Reasoning Reinforcement Learning Parallel Framework
摘要

“图像思维”新范式将视觉状态嵌入中间推理步骤。现有方法中,工具辅助法延迟高且操作受限,潜在推理法性能较差且难以捕捉有效视觉信息。本文提出 DeepLatent,一种用于潜在视觉推理的并行框架。首先引入 LatentFormer,利用可学习二维令牌并行生成上下文条件的潜在状态;其次设计连续空间强化学习算法,直接在嵌入空间优化潜在调制参数以提升表示质量。该框架经知识蒸馏与强化学习训练,并在专用数据集 DeepLatent-180K 上验证,实现了最先进的性能。

AI 推荐理由

论文提出并行潜在视觉推理框架,核心解决多模态推理中的隐式状态生成与优化问题。

研究机构
Baidu Inc. Peking University
论文信息
作者 Dongchen Lu, Zhimo Li, Mao Shu, Huo Cao
发布日期 2026-05-30
arXiv ID 2606.00562
相关性评分 9/10 (高度相关)