Competitive Programming Self-Evolution Risk Control Execution Feedback
摘要

大型语言模型在竞赛级编程中仍表现不佳,现有代理方案多依赖大量推理采样或昂贵的多阶段后训练。本文研究执行反馈何时能可靠辅助 LLM 编程求解器及其增益机制。通过将反馈驱动求解建模为校准停止过程,识别出虚假准入风险、程序级反证及活跃状态成功 hazard 三个关键量。基于预声明控制器清单的轨迹校准与选择,构建了清洁成功概率的结构化下界证书。据此实例化了双粒度验证、测试增强和经验驱动自我进化机制,形成 CP-Agent。该方法无需更新参数,即在 LiveCodeBench Pro 上将 Pass@1 从 25.8% 提升至 48.5%,并在 ICPC-Eval 上提升 Refine@5 达 11.0%。

AI 推荐理由

论文提出经验驱动的自我进化机制,通过反馈校准实现无参数更新的自我改进,核心聚焦 Agent 进化。

研究机构
The Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China
论文信息
作者 Peisong Wang, Bowen Liu, Zehua Li, Yuyao Wang, Zhiwei Ma et al.
发布日期 2026-05-23
arXiv ID 2605.24693
相关性评分 9/10 (高度相关)