摘要
针对具身智能中实时感知 - 决策 - 行动闭环的挑战,现有代理缺乏长期多模态记忆及实时推理能力。本文提出 StreamingClaw,一个统一的流式视频理解与具身智能框架。该框架集成五大核心能力:支持实时流式推理与未来事件预测;具备多模态长期存储、分层进化及跨代理共享记忆检索机制;实现感知 - 决策 - 行动闭环,并提供面向物理环境的流式工具与技能。通过与 OpenClaw 兼容,该框架实现了在线实时推理、长期记忆与主动交互的统一,支持具身交互的实际部署。
AI 推荐理由
论文核心提出多模态长期记忆架构,解决流式视频理解中的记忆瓶颈。
研究机构
小鹏汽车有限公司
论文信息