摘要
大型语言模型在竞赛级编程中仍表现不佳,现有代理方案多依赖大量推理采样或昂贵的多阶段后训练。本文研究执行反馈何时能可靠辅助 LLM 编程求解器及其增益机制。通过将反馈驱动求解建模为校准停止过程,识别出虚假准入风险、程序级反证及活跃状态成功 hazard 三个关键量。基于预声明控制器清单的轨迹校准与选择,构建了清洁成功概率的结构化下界证书。据此实例化了双粒度验证、测试增强和经验驱动自我进化机制,形成 CP-Agent。该方法无需更新参数,即在 LiveCodeBench Pro 上将 Pass@1 从 25.8% 提升至 48.5%,并在 ICPC-Eval 上提升 Refine@5 达 11.0%。
AI 推荐理由
论文提出经验驱动的自我进化机制,通过反馈校准实现无参数更新的自我改进,核心聚焦 Agent 进化。
研究机构
The Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China
论文信息