摘要
现有代码生成框架依赖大模型内部的心理模拟来验证正确性,但存在“心智 - 现实差距”,导致模型幻觉执行轨迹并错误验证有缺陷代码。该差距体现为规范差距(规划时忽略边界情况)和验证差距(对错误代码产生正确行为的幻觉)。本文提出 SolidCoder,遵循“不要想象,要执行”原则,通过在算法设计前强制感知边界情况,并利用基于属性的预言机进行沙箱执行以替代想象轨迹。实验表明,该方法在 HumanEval、CodeContests 和 APPS 基准上均取得最先进性能,证实弥合这两类差距对鲁棒代码合成至关重要。
AI 推荐理由
论文核心解决 LLM 代码生成中的推理幻觉,通过执行验证替代心理模拟,显著提升推理准确性。
研究机构
Electronics and Telecommunications Research Institute, Republic of Korea
论文信息