摘要
多智能体框架广泛用于自主代码生成,但现有方法依赖人工提供的公共测试用例进行调试与仿真,限制了其在真实场景的应用。本文指出这种依赖导致“过度自信差距”,使模型过拟合简单样例。为此,我们提出 DryRUN 框架,无需真实测试数据,允许大语言模型自主生成有效输入、模拟执行轨迹并迭代规划以自我修正。在 LiveCodeBench v6 上的评估表明,DryRUN 在完全不依赖公共测试或外部执行反馈的情况下,性能媲美最先进的方法,同时降低了令牌消耗。
AI 推荐理由
论文提出 DryRUN 框架,核心在于让 LLM 自主规划、生成输入并模拟执行以自我修正,属规划机制研究。
研究机构
WSO2, Santa Clara, CA, USA
论文信息