摘要
提升多模态大语言模型(MLLM)的具身推理能力对于构建视觉 - 语言 - 动作模型(VLA)至关重要。针对现有方法导致性能不稳定的问题,本文提出了 RoboAlign 训练框架。其核心思想是通过零样本自然语言推理采样动作令牌,并利用强化学习优化该推理过程以提高动作准确性。该方法有效弥合了 MLLM 中语言与底层动作之间的模态差距。实验表明,在仅使用不到 1% 数据进行基于强化学习的对齐后,RoboAlign 在多个基准测试中显著优于监督微调基线。
AI 推荐理由
论文核心提出利用测试时推理和强化学习对齐语言与动作,显著提升具身推理能力。
研究机构
韩国科学技术院
首尔国立大学
论文信息