摘要
尽管多模态大语言模型(MLLMs)进展迅速,但在人类轻易可解的任务(如网格迷宫导航)上仍表现不佳。本文提出 MUSE,一种无需重新训练即可封装任意现成 MLLM 的多模态统一结构化执行框架。该框架包含任务表示、视觉处理、感知工具使用及验证器引导修复等模块。实验表明,MUSE 在视觉空间规划、多模态推理等多个基准测试中均显著优于原始模型。研究揭示许多失败源于执行框架缺陷而非模型本身,突显了智能体多模态框架作为优化 MLLM 正交路径的重要性。
AI 推荐理由
论文核心在于构建执行框架以解决视觉空间规划等复杂任务,通过结构化流程提升 Agent 规划能力。
研究机构
东北大学
论文信息