摘要
大型语言模型代理依赖有效上下文进行决策,但现有方法多直接复用过往经验,增加了推理负担。本文提出 CLEAR 框架,利用代理反思对过往执行轨迹进行对比分析,总结任务特定的有用上下文。通过监督微调和强化学习训练上下文增强模型(CAM),使其学会生成而非检索知识。在 AppWorld 和 WebShop 基准测试中,CLEAR 显著提升了任务完成率和奖励得分,证明了其生成定制化上下文的有效性。
AI 推荐理由
论文提出基于反思的对比学习框架,核心在于优化 Agent 对过往经验的记忆利用与上下文生成机制。
研究机构
AWS AI Labs
论文信息