摘要
多模态大语言模型正日益被用作交互环境中的自主智能体,但其主动应对安全隐患的能力仍显不足。本文提出 SafetyALFRED,基于具身智能体基准 ALFRED 构建,并增加了六类现实厨房 hazards。现有安全评估多集中于非具身的问答识别,而本研究对 Qwen、Gemma 和 Gemini 系列的十一个前沿模型进行了评估,不仅考察隐患识别,更关注通过具身规划进行的主动风险缓解。实验揭示了显著的“对齐差距”:模型在问答中能准确识别隐患,但在实际执行中的缓解成功率较低。研究表明静态问答评估不足以保障物理安全,呼吁转向重视具身语境下纠正行动的评估范式。
AI 推荐理由
论文核心评估多模态模型在具身环境中的安全规划与风险缓解能力,直接对应规划主题。
研究机构
University of Michigan
论文信息