摘要
针对视觉 - 语言 - 动作(VLA)策略在长程和高不确定性控制中的脆弱性,本文提出 MPCoT 框架。该方法通过初始化多个假设、进行权重共享的迭代细化及软聚合,实现了无需生成额外推理 token 的深层潜在推理。利用仅训练阶段的路径偏好目标,结合专家一致性与世界模型反馈对齐潜在路径评分器。实验表明,MPCoT 在保持原有动作接口的同时,显著提升了长程任务性能,验证了推理深度与宽度的有效性。
AI 推荐理由
论文提出多路径潜在推理框架,核心在于提升测试时的推理深度与质量。
研究机构
Department of Electrical and Computer Engineering, Boston University, Boston, MA 02215, USA
Department of Computer Science, Tsinghua University, Beijing 100084, China
论文信息