Vision-Language-Action Latent Reasoning Test-Time Scaling Robotics
摘要

针对视觉 - 语言 - 动作(VLA)策略在长程和高不确定性控制中的脆弱性,本文提出 MPCoT 框架。该方法通过初始化多个假设、进行权重共享的迭代细化及软聚合,实现了无需生成额外推理 token 的深层潜在推理。利用仅训练阶段的路径偏好目标,结合专家一致性与世界模型反馈对齐潜在路径评分器。实验表明,MPCoT 在保持原有动作接口的同时,显著提升了长程任务性能,验证了推理深度与宽度的有效性。

AI 推荐理由

论文提出多路径潜在推理框架,核心在于提升测试时的推理深度与质量。

研究机构
Department of Electrical and Computer Engineering, Boston University, Boston, MA 02215, USA Department of Computer Science, Tsinghua University, Beijing 100084, China
论文信息
作者 Boyang Zhang, Lianlei Shan
发布日期 2026-06-04
arXiv ID 2606.06245
相关性评分 9/10 (高度相关)