Self-Repair Code Generation Iterative Refinement LLM Evaluation
摘要

本研究探讨了在大语言模型代码生成中,通过反馈执行错误进行迭代自修复的效果。实验涵盖七种不同规模和架构的模型,在 HumanEval 和 MBPP 基准上验证了自修复能显著提升通过率,增益主要集中在前两轮。研究发现现代指令微调模型仅需提示即可实现自修复,且思维链提示能进一步增加增益。此外,论文对比了稠密与混合专家架构在自修复中的表现,并分析了断言错误最难修复的现象,揭示了当前模型自我修正能力的边界。

AI 推荐理由

论文核心研究迭代自修复机制,属于 Agent 自我改进与自适应进化的关键范畴。

研究机构
Independent Researcher
论文信息
作者 Johin Johny Arimbur
发布日期 2026-04-12
arXiv ID 2604.10508
相关性评分 9/10 (高度相关)