摘要
高级图表问答需精确感知微小视觉元素并在多个子图间进行多步推理。现有模型虽擅长单图理解,但在跨子图多步推理上表现不佳。本文提出 HierVA,一种用于图表推理的分层视觉代理框架,能在联合图像 - 文本空间中迭代构建和更新工作上下文。高层管理器负责生成计划并维护仅含关键信息的紧凑上下文,而专用工作器执行推理、收集证据并返回结果。该代理特别维护独立的视觉与文本上下文,利用缩放工具限制视觉范围。实验表明其在 CharXiv 数据集上显著优于现有基线。
AI 推荐理由
论文提出分层代理框架,核心在于高层管理器生成计划并维护上下文,以解决多步推理难题。
研究机构
东北大学
论文信息