摘要
针对现有世界模型依赖像素监督导致策略敏感及长序列生成困难的问题,本文提出 World2Act 框架。该方法通过对比匹配目标将视觉 - 语言 - 动作策略与世界模型的潜在视频动态直接对齐,减少像素依赖。同时,设计自动化的 LLM 技能分解流水线,将高层指令分割为低层提示,构建支持任意时长任务且时间一致的技能组合世界模型。实验表明,该方法在多个基准测试中达到最先进水平,显著提升了具身智能体的泛化能力。
AI 推荐理由
论文提出基于 LLM 的技能分解流水线,核心解决技能组合与世界模型对齐问题。
研究机构
MHZUAI, UAE
论文信息