摘要
基于视觉语言模型(VLM)的图像质量评估(IQA)虽已引入思维链推理,但现有方法多以语言为中心,将视觉信息视为静态前提,受限于文本离散性与质量感知空间的差异。本文质疑自然语言是否为质量推理的理想空间,提出 Q-Tacit 新范式,引导 VLM 在潜质量空间进行超越自然语言的推理。该方法包含两阶段协同过程:向潜空间注入结构化视觉质量先验,并校准潜推理轨迹以提升评估能力。实验表明,Q-Tacit 能以显著更少的 token 实现高质量推理,验证了语言非视觉质量唯一紧凑表征的观点。
AI 推荐理由
论文提出潜空间视觉推理新范式,核心在于改进 VLM 的推理机制与表征空间。
研究机构
视觉信息实验室,布里斯托大学
南京理工大学
论文信息