摘要
随着多模态大语言模型的发展,GUI 智能体正从静态交互转向复杂导航。针对离线强化学习忽视全局轨迹语义、在线强化学习交互成本高的问题,本文提出 SOLAR-RL 框架。该方法利用静态数据重构候选轨迹,检测首个失败点,并逆向分配与目标对齐的密集步级奖励,从而在无额外交互成本下模拟在线反馈。实验表明,该方法显著提升了长程任务的完成率与鲁棒性,为自主 GUI 导航提供了高效的样本解决方案。
AI 推荐理由
论文核心解决长程任务规划中的奖励分配问题,通过半在线机制优化多步导航策略。
研究机构
vivo AI Lab
Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences
Zhejiang Lab
CUHK MMLab
Hubei University
论文信息