Autonomous Debugging Fault Localization Code Repair LLM Evaluation
摘要

随着大语言模型推动编程向“氛围编程”转变,智能体编码工具日益依赖模型自我诊断并修复细微故障。本文提出 VIBEPASS,首次联合评估故障触发测试生成与针对性程序修复两项任务。通过对 12 个前沿模型的评估,发现故障导向推理能力不随通用编码能力扩展,假设生成是主要瓶颈。研究表明,当自生成测试成功揭示故障时,修复效果优于外部引导,反之则恶化。结论指出,自主调试的核心挑战在于故障导向推理能力的缺失。

AI 推荐理由

论文核心评估 Agent 的故障定位与修复推理能力,指出推理瓶颈而非代码生成是主要挑战。

研究机构
Salesforce AI Research Nanyang Technological University A*STAR
论文信息
作者 Srijan Bansal, Jiao Fangkai, Yilun Zhou, Austin Xu, Shafiq Joty et al.
发布日期 2026-03-16
arXiv ID 2603.15921
相关性评分 9/10 (高度相关)