摘要
针对大模型在指令驱动代码编辑中可靠性不足的问题,本文提出 SAFEdit 多智能体框架。该框架将编辑过程分解为规划、执行与验证三个专用角色:规划器生成可见性感知的编辑计划,编辑器实施最小化修改,验证器执行真实测试。若测试失败,系统利用故障抽象层将日志转化为结构化反馈以支持迭代优化。在 EditBench 基准上的实验表明,该方法显著优于单模型及 ReAct 基线,有效减少幻觉并提升任务成功率。
AI 推荐理由
论文核心提出多智能体框架,通过规划器生成显式编辑计划分解任务,显著提升可靠性。
研究机构
Ben-Gurion University of the Negev
论文信息