摘要
智能家居正演变为复杂的状依赖环境,要求大语言模型(LLM)能针对用户意图、偏好及设备交互进行推理。现有基准多关注静态指令映射,难以评估真实场景下的可靠性。为此,本文提出 SMH-Bench,一个基于可执行模拟器 HomeEnv 的综合基准,涵盖 7 大类、22 子类共 1100 项任务,并跨越不同复杂度的家居环境。实验表明,尽管前沿模型在显式控制上表现良好,但在自动化调度、歧义处理及个性化推理方面仍存在显著缺陷,尤其随环境复杂度增加而加剧。该基准旨在推动更可靠、具上下文感知能力的智能家居智能体发展。
AI 推荐理由
论文核心评估 LLM 在智能家居中的环境 grounding 推理、意图理解及复杂场景下的逻辑判断能力。
研究机构
Midea Group
Donghua University
Beijing University of Posts and Telecommunications
The University of Sydney
论文信息