摘要
针对单体视觉 - 动作模型在编码长时上下文时超出实时计算预算的问题,本文提出 COMPACT-VA,一种基于条件 VQ-VAE 的规划对齐工作记忆框架。该方法将扩展上下文压缩为有界表示,压缩过程由历史轨迹及从未来轨迹蒸馏出的规划意图共同调节。压缩后的记忆与预测潜在变量拼接输入策略网络,实现端到端优化,确保保留决策关键信息。实验表明,在同等 Token 预算下,成功率提升超 6%,且显著加速推理并降低内存占用。
AI 推荐理由
提出规划对齐的工作记忆框架,核心解决长上下文压缩与关键信息保留问题。
研究机构
香港大学
论文信息