Tool Evolution Code Quality Agent Evaluation Software Engineering
摘要

现代 LLM 智能体常在运行时创建自有工具,但现有基准仅通过下游任务完成度进行评估,忽视了冗余、回归和安全等软件质量指标。本文提出 EvolveTool-Bench,一个针对软件工程工作流中 LLM 生成工具库的诊断基准。该基准在三个需实际执行工具的领域定义了库级质量指标(如复用性、冗余度、组合成功率等)及单工具质量评分。实验表明,任务完成率相近的系统在库健康度上差异显著,揭示了仅关注任务评估的盲区,强调应将演进中的工具库视为一级软件制品进行治理。

AI 推荐理由

论文核心评估 LLM 生成工具库的自我进化质量,提出代码级与策略级进化对比。

研究机构
University of Texas at Austin Uber Technologies
论文信息
作者 Alibek T. Kaliyev, Artem Maryanskyy
发布日期 2026-04-01
arXiv ID 2604.00392
相关性评分 9/10 (高度相关)