摘要
本文研究了基于大语言模型的网络智能体如何执行表示为工具调用序列的网络过程。通过对比四种方法,评估了用户设备 IP 分配案例中的延迟与执行正确性,并进行了压力测试以探究多步执行的可靠性极限。结果表明,将过程封装在单一工具内可显著降低延迟并减少错误;尽管先进模型支持更长序列,但所有模型随步骤增加均出现可靠性下降。此外,文章提出了针对过程执行的错误分类法以系统分析故障。
AI 推荐理由
核心研究 LLM Agent 的工具调用序列执行、多步工作流可靠性及错误分类。
研究机构
Heisenberg Research Center, Huawei Technologies Dusseldorf GmbH, 80992 Munich, Germany
Eindhoven University of Technology, Eindhoven, The Netherlands
论文信息