Vision-Language Models Recurrent Reasoning Embodied AI Task Progress Estimation Chain of Thought
摘要

准确估计任务进度对具身智能体规划执行长程多步任务至关重要。现有基于视觉 - 语言模型(VLM)的方法主要利用视频理解能力,忽视了复杂推理潜力,且处理长视频轨迹计算成本高昂。为此,本文提出循环推理视觉 - 语言模型(R²VLM)。该模型采用循环推理框架迭代处理局部视频片段,通过演化的思维链(CoT)维持全局上下文,显式记录任务分解、关键步骤及完成状态,以推理复杂时间依赖关系。该方法在避免高计算成本的同时保留了核心推理能力,并在多项下游应用中达到最先进水平。

AI 推荐理由

提出循环推理框架,利用思维链显式记录任务分解与状态,核心解决长程推理问题。

研究机构
智谱AI 清华大学人工智能研究院 北京智谱华章科技有限公司 清华大学
论文信息
作者 Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang et al.
发布日期 2026-03-18
arXiv ID 2603.17312
相关性评分 9/10 (高度相关)