摘要
推理分割常利用强化学习生成解释性推理链以指导多模态大模型。然而,现有几何奖励仅能引导最终定位,无法判别推理过程是否偏离目标区域。缺乏此类判别指导导致推理链冗长且焦点模糊。为此,本文提出 DPAD 方法,强制模型生成目标对象的描述性标题,并通过对比其语义相关性与背景上下文来实现显式判别。优化该判别能力迫使模型聚焦目标独特属性,从而生成更收敛、高效的推理链。实验表明,该方法在 ReasonSeg 基准上 cIoU 提升 3.09%,推理链长度减少约 42%。
AI 推荐理由
论文核心提出判别感知机制以优化推理链,解决推理发散问题,显著提升推理效率与准确性。
研究机构
西北工业大学
论文信息