Embodied AI Reinforcement Learning Vision-Language-Action Models Test-Time Reasoning
摘要

提升多模态大语言模型(MLLM)的具身推理能力对于构建视觉 - 语言 - 动作模型(VLA)至关重要。针对现有方法导致性能不稳定的问题,本文提出了 RoboAlign 训练框架。其核心思想是通过零样本自然语言推理采样动作令牌,并利用强化学习优化该推理过程以提高动作准确性。该方法有效弥合了 MLLM 中语言与底层动作之间的模态差距。实验表明,在仅使用不到 1% 数据进行基于强化学习的对齐后,RoboAlign 在多个基准测试中显著优于监督微调基线。

AI 推荐理由

论文核心提出利用测试时推理和强化学习对齐语言与动作,显著提升具身推理能力。

研究机构
韩国科学技术院 首尔国立大学
论文信息
作者 Dongyoung Kim, Sumin Park, Woomin Song, Seungku Kim, Taeyoung Kim et al.
发布日期 2026-03-22
arXiv ID 2603.21341
相关性评分 9/10 (高度相关)