Benchmark Smart Home Environment-Grounded Reasoning LLM Agents
摘要

智能家居正演变为复杂的状依赖环境,要求大语言模型(LLM)能针对用户意图、偏好及设备交互进行推理。现有基准多关注静态指令映射,难以评估真实场景下的可靠性。为此,本文提出 SMH-Bench,一个基于可执行模拟器 HomeEnv 的综合基准,涵盖 7 大类、22 子类共 1100 项任务,并跨越不同复杂度的家居环境。实验表明,尽管前沿模型在显式控制上表现良好,但在自动化调度、歧义处理及个性化推理方面仍存在显著缺陷,尤其随环境复杂度增加而加剧。该基准旨在推动更可靠、具上下文感知能力的智能家居智能体发展。

AI 推荐理由

论文核心评估 LLM 在智能家居中的环境 grounding 推理、意图理解及复杂场景下的逻辑判断能力。

研究机构
Midea Group Donghua University Beijing University of Posts and Telecommunications The University of Sydney
论文信息
作者 Kuan Li, Shuo Zhang, Huacan Wang, Fangzhou Yu, Zecheng Sheng et al.
发布日期 2026-06-01
arXiv ID 2606.01912
相关性评分 9/10 (高度相关)