Web Agent Multimodal Learning Open Source GUI Perception Skill Learning
摘要

针对当前高性能 Web Agent 依赖闭源模型的问题,本文提出完全开源的多模态 Web Agent 系列 MolmoWeb 及混合数据集 MolmoWebMix。该数据集融合超 10 万条合成轨迹与 3 万条人类演示,涵盖原子级网页技能与 GUI 感知数据。MolmoWeb 代理作为指令条件的视觉 - 语言动作策略,仅凭截图即可预测浏览器动作,无需访问 HTML 或专用 API。实验表明,其在多个基准测试中超越同规模开源模型及部分闭源大模型,并通过测试时扩展显著提升性能,旨在推动开放网络代理研究的可复现性与社区进步。

AI 推荐理由

论文核心在于构建具备网页操作技能(如点击、导航)的多模态 Agent,并开源相关训练数据。

研究机构
Allen Institute for AI University of Washington UNC-Chapel Hill
论文信息
作者 Tanmay Gupta, Piper Wolters, Zixian Ma, Peter Sushko, Rock Yuren Pang et al.
发布日期 2026-04-09
arXiv ID 2604.08516
相关性评分 9/10 (高度相关)