Reinforcement Learning GUI Agents Long-horizon Planning Sample Efficiency
摘要

随着多模态大语言模型的发展,GUI 智能体正从静态交互转向复杂导航。针对离线强化学习忽视全局轨迹语义、在线强化学习交互成本高的问题,本文提出 SOLAR-RL 框架。该方法利用静态数据重构候选轨迹,检测首个失败点,并逆向分配与目标对齐的密集步级奖励,从而在无额外交互成本下模拟在线反馈。实验表明,该方法显著提升了长程任务的完成率与鲁棒性,为自主 GUI 导航提供了高效的样本解决方案。

AI 推荐理由

论文核心解决长程任务规划中的奖励分配问题,通过半在线机制优化多步导航策略。

研究机构
vivo AI Lab Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences Zhejiang Lab CUHK MMLab Hubei University
论文信息
作者 Jichao Wang, Liuyang Bian, Yufeng Zhou, Han Xiao, Yue Pan et al.
发布日期 2026-04-24
arXiv ID 2604.22558
相关性评分 9/10 (高度相关)