多模态代理 感知推理交织 具身智能 动态问答
摘要

将基于大语言模型的具身智能体从纯文本环境扩展至复杂多模态场景仍面临巨大挑战。现有视觉 - 语言模型常存在感知 - 推理 - 决策鸿沟,易忽略关键任务信息。本文提出 PRISM 框架,通过动态问答流水线紧密耦合感知与决策模块。大语言模型主动批判并探测视觉模型,生成面向目标的紧凑场景描述。该闭环交互实现了对场景的锐利、任务驱动型理解。在 ALFWorld 和 R2R 基准上的评估表明,PRISM 显著优于现有最先进模型,其交互式目标导向感知流程带来了系统性提升,且全程自动化无需人工干预。

AI 推荐理由

论文核心提出感知与推理交织框架,通过动态问答闭环显著提升多模态决策中的推理质量。

研究机构
Sorbonne Universite, CNRS, ISIR, F-75005 Paris, France
论文信息
作者 Mohamed Salim Aissi, Clemence Grislain, Clement Romac, Laure Soulier, Mohamed Chetouani et al.
发布日期 2026-05-06
arXiv ID 2605.05407
相关性评分 9/10 (高度相关)