摘要
“图像思维”新范式将视觉状态嵌入中间推理步骤。现有方法中,工具辅助法延迟高且操作受限,潜在推理法性能较差且难以捕捉有效视觉信息。本文提出 DeepLatent,一种用于潜在视觉推理的并行框架。首先引入 LatentFormer,利用可学习二维令牌并行生成上下文条件的潜在状态;其次设计连续空间强化学习算法,直接在嵌入空间优化潜在调制参数以提升表示质量。该框架经知识蒸馏与强化学习训练,并在专用数据集 DeepLatent-180K 上验证,实现了最先进的性能。
AI 推荐理由
论文提出并行潜在视觉推理框架,核心解决多模态推理中的隐式状态生成与优化问题。
研究机构
Baidu Inc.
Peking University
论文信息