Benchmark Tool Use Industrial AI Agent Evaluation
摘要

针对现有基准无法反映工业领域严苛需求的问题,本文提出 PHMForge,首个专为评估大语言模型智能体在故障预测与健康管理(PHM)任务表现的基准。该基准涵盖 75 个专家策划场景及 65 种专用工具,通过真实交互测试智能体的工具编排能力。实验表明,即便顶尖模型在工具序列化和跨设备泛化上仍存在显著缺陷,任务完成率仅 68%。本研究开源了完整基准以推动工业 AI 发展。

AI 推荐理由

论文核心评估 Agent 在工业场景下的工具编排、调用及多步执行能力,属技能学习范畴。

研究机构
佐治亚理工学院 IBM
论文信息
作者 Ayan Das, Dhaval Patel
发布日期 2026-04-02
arXiv ID 2604.01532
相关性评分 9/10 (高度相关)