Multimodal Reasoning Benchmark Browsing Agent Visual Search
摘要

针对现有基准在视觉推理评估及网页原生视觉信息利用方面的不足,本文提出了 VisBrowse-Bench。该基准包含 169 个跨领域 VQA 实例,通过文本 - 图像检索与联合推理中的多模态证据交叉验证,评估模型在搜索过程中的视觉推理能力。数据经专家多阶段构建并严格校验。此外,本文提出了一种智能体工作流,驱动代理主动收集并推理视觉信息。实验表明,即便表现最佳的 Claude-4.6-Opus 准确率也仅为 47.6%,凸显了当前模型在该任务上的挑战。

AI 推荐理由

论文核心聚焦于评估和提升多模态浏览代理在搜索过程中的视觉推理能力。

研究机构
CASIA Ant Digital Technologies RUC PKU
论文信息
作者 Zhengbo Zhang, Jinbo Su, Zhaowen Zhou, Changtao Miao, Yuhan Hong et al.
发布日期 2026-03-17
arXiv ID 2603.16289
相关性评分 9/10 (高度相关)