code generation execution feedback consensus mechanism LLM evaluation
摘要

大语言模型代码生成流程通常在无完整标准答案时采样多个候选并择优。现有方法混合文本投票、排序及执行一致性,但各组件贡献不明。本文对比了 18 种配置,发现基于执行的筛选显著优于文本多数投票。一旦候选在多样输入上执行,聚合规则影响有限,输入质量成为关键因素。此外,深度思考对多数投票有益,却可能降低基于执行方法的候选多样性。结果表明,推断时代码选择本质是信号质量问题,行为证据比聚合规则更重要。

AI 推荐理由

研究代码生成中的推理验证与选择机制,通过执行反馈提升逻辑正确性。

研究机构
The University of Texas at Austin
论文信息
作者 Shan Jiang, Zijian Yi, Chenguang Zhu
发布日期 2026-05-09
arXiv ID 2605.08680
相关性评分 8/10 (高度相关)