摘要
研究发现,推理型视觉语言模型(VLM)在思考过程中准确性虽提升,但逐渐丧失视觉接地,导致出现文本监控无法检测的低熵却无依据的危险预测区。实验表明存在普遍的“证据坍塌”现象:随着推理展开,对标注证据区域的注意力大幅下降。基于此,作者提出任务感知的多模态监控机制,利用熵与视觉特征的交互模型识别危险状态,并通过针对性的视觉否决策略显著降低选择性风险,支持分布偏移下的安全部署。
AI 推荐理由
论文核心研究多模态推理过程中的证据坍塌现象及视觉接地丢失问题。
研究机构
Independent Researcher, New Delhi, India
论文信息