Vision-Language Models Hallucination Reduction Structured Reasoning Adaptive Strategy
摘要

视觉语言模型(VLM)是机器人自动化高层推理的基石,但其易产生幻觉,导致决策失败及安全风险。针对现实任务开放性强、难度多变带来的挑战,本文提出伪代码引导结构化推理框架(PStar)。该框架构建了抽象推理函数库与结构化伪代码,并设计难度特征向量(DFV),使模型能评估问题复杂度并自适应选择推理策略。实验表明,PStar 显著降低幻觉率,在 POPE 和 MMStar 基准上分别达到 87.1% 和 68.0% 的最先进成绩,优于 GPT-4V,为部署可信 VLM 提供了关键机制。

AI 推荐理由

论文提出伪代码引导的结构化推理框架,核心解决 VLM 幻觉与推理可靠性问题。

研究机构
清华大学
论文信息
作者 Weicong Ni, Tianbao Jiang, Linlin Wang
发布日期 2026-05-19
arXiv ID 2605.19663
相关性评分 9/10 (高度相关)