摘要
构建能解决复杂现实任务的通用具身智能体仍是 AI 领域的重大挑战。尽管多模态大语言模型(MLLM)凭借强大的视觉 - 语言知识和思维链推理提升了智能体能力,但在分布外场景中仍显脆弱。为此,本文提出验证器引导的动作选择(VeGAS)框架,通过在推理时采样候选动作并利用生成式验证器识别最可靠选项,显著提升鲁棒性。研究发现直接使用现成 MLLM 作为验证器无效,因此提出了基于 LLM 的数据合成策略,自动构建失败案例课程以训练验证器。实验表明,VeGAS 在 Habitat 和 ALFRED 基准上显著优于强基线方法。
AI 推荐理由
论文核心提出验证器引导的动作选择框架,旨在增强具身智能体在复杂场景下的推理鲁棒性。
研究机构
Technical University of Darmstadt & hessian.AI
论文信息