摘要
思维链(CoT)推理显著提升了多模态大语言模型的复杂问题解决能力。然而,将 CoT 适配于视觉任务时通常需离散化信号,导致早期语义坍缩及细粒度细节丢失。外部工具虽可缓解此问题,却引入了刚性瓶颈。近期潜在推理范式虽内化了视觉状态,但混合离散 - 连续动作空间的优化仍具挑战。本文提出 HyLaR 框架,无缝交织离散文本生成与连续视觉潜在表示。在监督微调基础上,引入解耦策略优化(DePO),通过对文本和潜在分量施加独立信任域约束及精确的冯·米塞斯 - 费希尔 KL 正则项,实现混合空间内的有效强化学习。实验表明,HyLaR 在细粒度感知及通用多模态理解基准上均优于现有最先进方法。
AI 推荐理由
论文提出混合潜在推理框架,核心解决多模态思维链中的离散 - 连续空间优化难题。
研究机构
Tencent PCG
Tencent CSIG
论文信息