Multimodal Reasoning Chain-of-Thought Visual Retention Policy Optimization Information Theory
摘要

长链思维推理提升了大型视觉语言模型性能,但生成过程中视觉信息易衰减,限制了长程多模态推理。现有方法依赖启发式感知进行干预,缺乏原则性增益分析。本文从信息论角度出发,推导单步干预的下界,提出反射锚点策略优化(RAPO)。该方法基于 GRPO 选择高熵反射锚点,并优化链掩码有限窗口 KL 代理以增强下游视觉依赖性。实验表明,RAPO 在多个基准测试中显著优于强基线,机制分析证实了其能 enrich 视觉敏感决策点并增强对比性视觉依赖信号。

AI 推荐理由

论文核心解决长链思维推理中视觉信息衰减问题,提出基于信息论的干预策略以增强多模态推理能力。

研究机构
Shanghai Jiao Tong University Lanzhou University
论文信息
作者 Xuan Gong, Hanbo Huang, Hao Zheng, Yiran Zhang, Wenbin Dai et al.
发布日期 2026-05-10
arXiv ID 2605.09614
相关性评分 9/10 (高度相关)