Continuous Learning User Feedback Agent Optimization Experience Data
摘要

静态“人类数据”存在扩展成本高且受限于创作者知识的固有缺陷。从代理与环境交互产生的“经验数据”中进行持续学习有望突破这些障碍。然而,原始交互日志充满噪声且信息密度低,难以直接用于训练。本文提出 Echo 框架,旨在将原始经验转化为可学习知识,利用用户 driven 的精炼过程(将 flawed 提议转化为验证方案)提取高质量训练信号。在生产代码补全环境中的大规模验证表明,Echo 有效利用该流程,将接受率从 25.7% 提升至 35.7%,突破了静态性能上限。

AI 推荐理由

论文核心在于利用用户反馈驱动 Agent 从经验数据中持续学习与自我改进,打破性能天花板。

研究机构
Tencent, CodeBuddy
论文信息
作者 Hande Dong, Xiaoyun Liang, Jiarui Yu, Jiayi Lin, Changqing Ai et al.
发布日期 2026-05-21
arXiv ID 2605.21984
相关性评分 9/10 (高度相关)