Spatial Reasoning Token Pruning Event Cameras Video-LLM Efficiency
摘要

第一人称动态空间推理要求模型追踪连续运动并理解精确几何结构,但基于 Transformer 的视频大语言模型因注意力机制的计算复杂度而面临高昂成本。现有令牌剪枝方法多依赖离散静态快照,难以保留推理所需的关键运动与几何线索。本文提出事件级联剪枝(ECP),这是首个无需训练的框架,利用事件相机的高频运动线索作为连续引导先验来指导令牌选择。ECP 包含三个阶段:事件触发因果采样、事件引导运动显著性过滤及事件注意力排名融合。实验表明,在减少 80% 视觉令牌的情况下,ECP 不仅提升了推理速度并降低了计算量,还在新构建的真实世界基准 ESR-Real 上超越了全令牌基线。

AI 推荐理由

论文核心解决第一人称动态空间推理问题,通过剪枝优化提升推理效率与精度。

研究机构
深圳国际研究生院,清华大学 哈工大(深圳)
论文信息
作者 Pengtao Ma, Ziliang Zhou, Ciyu Ruan, Haoyang Wang, Kaiyuan Li et al.
发布日期 2026-05-19
arXiv ID 2605.19506
相关性评分 9/10 (高度相关)