Visual Reasoning LVLM Reinforcement Learning Hallucination Mitigation
摘要

尽管大型视觉语言模型(LVLMs)取得成功,但通用优化目标往往导致语言偏差和幻觉。现有方法引入几何先验作为监督,但通常次优且推理效用有限。为此,本文提出感知流网络(PFlowNet),通过解耦感知与推理建立自条件生成过程。该方法结合变分强化学习,整合多维奖励与邻近几何塑造,在保持视觉可靠性的同时促进面向推理的感知行为。实验表明,PFlowNet 在 V* Bench 和 MME-RealWorld-lite 上刷新了最先进记录。

AI 推荐理由

论文核心提出感知流网络以解决视觉推理中的幻觉问题,显著提升推理能力。

研究机构
ECNU SCU HKUST SJTU Ant Group Shanghai AI Laboratory
论文信息
作者 Yangfu Li, Yuning Gong, Hongjian Zhan, Teng Li, Yuanhuiyi Lyu et al.
发布日期 2026-05-04
arXiv ID 2605.02730
相关性评分 9/10 (高度相关)