Safety Evaluation Embodied AI Multimodal LLM Risk Mitigation
摘要

多模态大语言模型正日益被用作交互环境中的自主智能体,但其主动应对安全隐患的能力仍显不足。本文提出 SafetyALFRED,基于具身智能体基准 ALFRED 构建,并增加了六类现实厨房 hazards。现有安全评估多集中于非具身的问答识别,而本研究对 Qwen、Gemma 和 Gemini 系列的十一个前沿模型进行了评估,不仅考察隐患识别,更关注通过具身规划进行的主动风险缓解。实验揭示了显著的“对齐差距”:模型在问答中能准确识别隐患,但在实际执行中的缓解成功率较低。研究表明静态问答评估不足以保障物理安全,呼吁转向重视具身语境下纠正行动的评估范式。

AI 推荐理由

论文核心评估多模态模型在具身环境中的安全规划与风险缓解能力,直接对应规划主题。

研究机构
University of Michigan
论文信息
作者 Josue Torres-Fonseca, Naihao Deng, Yinpei Dai, Shane Storks, Yichi Zhang et al.
发布日期 2026-04-21
arXiv ID 2604.19638
相关性评分 9/10 (高度相关)