摘要
针对现有基准无法反映工业领域严苛需求的问题,本文提出 PHMForge,首个专为评估大语言模型智能体在故障预测与健康管理(PHM)任务表现的基准。该基准涵盖 75 个专家策划场景及 65 种专用工具,通过真实交互测试智能体的工具编排能力。实验表明,即便顶尖模型在工具序列化和跨设备泛化上仍存在显著缺陷,任务完成率仅 68%。本研究开源了完整基准以推动工业 AI 发展。
AI 推荐理由
论文核心评估 Agent 在工业场景下的工具编排、调用及多步执行能力,属技能学习范畴。
研究机构
佐治亚理工学院
IBM
论文信息