摘要
长链思维推理提升了大型视觉语言模型性能,但生成过程中视觉信息易衰减,限制了长程多模态推理。现有方法依赖启发式感知进行干预,缺乏原则性增益分析。本文从信息论角度出发,推导单步干预的下界,提出反射锚点策略优化(RAPO)。该方法基于 GRPO 选择高熵反射锚点,并优化链掩码有限窗口 KL 代理以增强下游视觉依赖性。实验表明,RAPO 在多个基准测试中显著优于强基线,机制分析证实了其能 enrich 视觉敏感决策点并增强对比性视觉依赖信号。
AI 推荐理由
论文核心解决长链思维推理中视觉信息衰减问题,提出基于信息论的干预策略以增强多模态推理能力。
研究机构
Shanghai Jiao Tong University
Lanzhou University
论文信息