摘要
随着多模态大语言模型智能体从实验室助手演变为自动驾驶操作员,实验室环境对安全性提出了严苛要求。针对现有具身智能体在高风险场景中安全意识与决策可靠性评估不足的问题,本文提出 LABSHIELD,一个基于 OSHA 和 GHS 标准的真实多视角基准。该基准涵盖 164 项操作任务,旨在评估危险识别与安全关键推理能力。实验结果显示,通用领域准确率与安全性能之间存在显著差距,突显了构建以安全为中心的推理框架以确保自主科学实验可靠性的紧迫性。
AI 推荐理由
论文核心评估智能体在高风险实验室环境下的安全规划与决策可靠性,直接针对规划能力。
研究机构
清华大学
论文信息