Self-Evolving Agents Experience Management Implicit Reward Financial Prediction
摘要

基于经验的自我进化对大语言模型代理至关重要,但现有基准常假设目标明确、任务稳定且反馈清晰。本文研究更具挑战性的低重复任务与隐式奖励场景,其中过往经验难复用且反馈延迟嘈杂。我们提出了 FinEvolveBench,一个用于金融情感预测的时间控制基准,将新闻驱动预测与未来超额收益关联。此外,我们提出“经验之树”(ToE),一种结构化经验管理方法,用于组织、检索、验证和更新代理经验。实验表明,通用经验机制表现不稳定,而 ToE 显著提升了自进化代理在隐式奖励环境中的性能。

AI 推荐理由

论文核心提出面向自我进化代理的结构化经验管理方法,直接解决低重复隐式奖励下的进化难题。

研究机构
Yining Zhu Leiming Wang Jingfei Lu Chuncheng Ran Yu Yang Dixuan Yang Jikun Shen
论文信息
作者 Zihao Deng, Yining Zhu, Leiming Wang, Jingfei Lu, Junbo Wang et al.
发布日期 2026-06-05
arXiv ID 2606.06960
相关性评分 9/10 (高度相关)