摘要
本文探讨了移动世界模型在引导 GUI 智能体中的作用,重点解决长程高风险交互中的动作后果预测问题。研究对比了文本与图像等多种模态的世界模型表现,发现可渲染代码在分布内重建上 fidelity 高,而文本反馈在分布外执行中更鲁棒。实验表明,世界模型生成的轨迹可作为训练数据提升端到端任务性能,但对于过度自信的智能体,其后验自我反思增益有限,建议将其主要用于先验感知或训练监督。
AI 推荐理由
研究世界模型预测动作后果以指导长程任务规划,是关键部分。
研究机构
南洋理工大学
论文信息