摘要
图形用户界面(GUI)智能体虽在自动化交互中表现优异,但主要依赖静态参数知识,难以处理缺乏显式过程知识的长尾任务。为此,本文提出“主动文档引导行动”新范式,使智能体能像人类一样自主搜索相关文档以解决问题。同时推出 DocOS 基准,评估智能体在动态环境中导航网页、定位文档、理解指令并将其转化为精确 GUI 动作的能力。实验表明,当前智能体在信息检索与指令落地方面存在双重瓶颈,文档引导交互是实现自我进化 GUI 智能体的关键路径。
AI 推荐理由
论文核心研究 Agent 主动检索文档并转化为 GUI 操作技能的能力,解决长尾任务。
研究机构
School of Computer Science and Engineering, Beihang University, China
School of Computer Science and Technology, Beijing Institute of Technology, China
论文信息