Web Agent Curriculum Learning Preference Optimization Hard Negative Mining
摘要

针对真实世界 HTML 噪声大且异构导致基于文本的 Web 代理开发困难的问题,本文提出 Triton 数据集及渐进式训练课程。Triton 利用结构 - 语义硬负例挖掘和双代理共识管道构建。在此基础上,课程生成了三个模型:用于基础模仿的 Triton-SFT-32B、通过几率比偏好优化实现鲁棒判别的 Triton-ORPO-32B,以及通过组相对策略优化确保长程一致性的 Triton-GRPO-32B。实验表明,Triton-GRPO-32B 在 Mind2Web 上步成功率达 58.7%,超越 GPT-4.5 等闭源模型,验证了专用数据课程优于单纯参数规模。

AI 推荐理由

论文核心研究基于文本的 Web 导航技能,通过课程学习提升工具使用与元素选择的鲁棒性。

研究机构
北京交通大学
论文信息
作者 Chuang Peng, Wei Zhang, Renshuai Tao, Xinhao Zhang, Jian Yang
发布日期 2026-04-14
arXiv ID 2604.12666
相关性评分 9/10 (高度相关)