摘要
静态“人类数据”存在扩展成本高且受限于创作者知识的固有缺陷。从代理与环境交互产生的“经验数据”中进行持续学习有望突破这些障碍。然而,原始交互日志充满噪声且信息密度低,难以直接用于训练。本文提出 Echo 框架,旨在将原始经验转化为可学习知识,利用用户 driven 的精炼过程(将 flawed 提议转化为验证方案)提取高质量训练信号。在生产代码补全环境中的大规模验证表明,Echo 有效利用该流程,将接受率从 25.7% 提升至 35.7%,突破了静态性能上限。
AI 推荐理由
论文核心在于利用用户反馈驱动 Agent 从经验数据中持续学习与自我改进,打破性能天花板。
研究机构
Tencent, CodeBuddy
论文信息