摘要
基于经验的自我进化对大语言模型代理至关重要,但现有基准常假设目标明确、任务稳定且反馈清晰。本文研究更具挑战性的低重复任务与隐式奖励场景,其中过往经验难复用且反馈延迟嘈杂。我们提出了 FinEvolveBench,一个用于金融情感预测的时间控制基准,将新闻驱动预测与未来超额收益关联。此外,我们提出“经验之树”(ToE),一种结构化经验管理方法,用于组织、检索、验证和更新代理经验。实验表明,通用经验机制表现不稳定,而 ToE 显著提升了自进化代理在隐式奖励环境中的性能。
AI 推荐理由
论文核心提出面向自我进化代理的结构化经验管理方法,直接解决低重复隐式奖励下的进化难题。
研究机构
Yining Zhu
Leiming Wang
Jingfei Lu
Chuncheng Ran
Yu Yang
Dixuan Yang
Jikun Shen
论文信息