摘要
构建捕捉动作前提与效果的高效模型对于将 AI 规划应用于现实领域至关重要。本文针对更具挑战性的场景:在缺乏动作观测的情况下,仅从状态图像序列中学习提升的动作模型。我们提出了一种深度学习框架,联合学习状态预测、动作预测及提升的动作模型。此外,引入混合整数线性规划(MILP)以防止预测崩溃和自强化错误,通过求解逻辑一致的状态与动作来修正预测,并利用生成的伪标签指导后续训练。实验表明,该方法有助于模型逃离局部最优并收敛至全局一致解。
AI 推荐理由
论文核心在于从视觉轨迹中学习动作模型以支持 AI 规划,直接解决规划领域的基础建模问题。
研究机构
School of Computing, The Australian National University
论文信息