摘要
尽管大型视觉语言模型(LVLMs)取得成功,但通用优化目标往往导致语言偏差和幻觉。现有方法引入几何先验作为监督,但通常次优且推理效用有限。为此,本文提出感知流网络(PFlowNet),通过解耦感知与推理建立自条件生成过程。该方法结合变分强化学习,整合多维奖励与邻近几何塑造,在保持视觉可靠性的同时促进面向推理的感知行为。实验表明,PFlowNet 在 V* Bench 和 MME-RealWorld-lite 上刷新了最先进记录。
AI 推荐理由
论文核心提出感知流网络以解决视觉推理中的幻觉问题,显著提升推理能力。
研究机构
ECNU
SCU
HKUST
SJTU
Ant Group
Shanghai AI Laboratory
论文信息