autonomous code generation self-correction simulation-driven planning LLM agents
摘要

多智能体框架广泛用于自主代码生成,但现有方法依赖人工提供的公共测试用例进行调试与仿真,限制了其在真实场景的应用。本文指出这种依赖导致“过度自信差距”,使模型过拟合简单样例。为此,我们提出 DryRUN 框架,无需真实测试数据,允许大语言模型自主生成有效输入、模拟执行轨迹并迭代规划以自我修正。在 LiveCodeBench v6 上的评估表明,DryRUN 在完全不依赖公共测试或外部执行反馈的情况下,性能媲美最先进的方法,同时降低了令牌消耗。

AI 推荐理由

论文提出 DryRUN 框架,核心在于让 LLM 自主规划、生成输入并模拟执行以自我修正,属规划机制研究。

研究机构
WSO2, Santa Clara, CA, USA
论文信息
作者 Kaushitha Silva, Srinath Perera
发布日期 2026-04-23
arXiv ID 2604.21598
相关性评分 9/10 (高度相关)