摘要
部署安全关键型智能体需在执行前预判行动后果。现有基于视觉模拟的世界模型延迟过高。本文提出 DILLO,一种蒸馏语言 - 动作世界模型,挑战了视觉处理对故障预防的必要性。该方法利用训练策略的潜在状态与计划动作编码信息,通过跨模态蒸馏,由视觉语言教师模型标注离线轨迹,指导潜在条件大语言模型学生预测语义结果。此举构建了纯文本推理路径,绕过繁重的视觉生成,速度提升 14 倍。实验表明,DILLO 能高精度描述下一状态并有效引导策略,显著提升任务成功率。
AI 推荐理由
论文核心在于通过预测行动结果来主动引导策略,属于任务执行前的规划与前瞻机制。
研究机构
罗马大学
格勒诺布尔阿尔卑斯大学
论文信息