摘要
针对视觉语言模型在误导性图表问答中面临的挑战,本文提出 ChartCynics,一种基于“怀疑式”推理范式的双路径智能体框架。该框架将感知与验证解耦:诊断视觉路径通过策略性区域裁剪捕捉结构异常,而 OCR 驱动数据路径确保数值基础。为解决跨模态冲突,引入经两阶段协议优化的智能体总结器,有效惩罚视觉陷阱并强制逻辑一致性。实验表明,该方法显著提升了开源模型的鲁棒性与准确率,超越了现有最先进专有模型。
AI 推荐理由
论文提出“怀疑式”推理范式,核心在于解耦感知与验证以解决逻辑冲突,属推理机制研究。
研究机构
HKUST, China
论文信息