reinforcement learning continuous learning agent training real-world feedback
摘要

实时未来预测指在现实事件发生前对其进行预测,该任务对构建能从现实世界持续学习的代理至关重要。本文提出 FutureWorld,一个实时代理强化学习环境,旨在闭合预测、结果实现与参数更新之间的训练循环。通过在三个开源基座模型上进行连续多日训练,结果表明该方法有效。此外,基于该环境构建了每日基准,评估了多个前沿代理系统,确立了当前性能基线。

AI 推荐理由

论文提出实时环境训练代理,通过真实结果反馈更新参数,实现持续学习与自我进化。

研究机构
中国科学院大学,软件科学学院,中国科学院大学
论文信息
作者 Zhixin Han, Yanzhi Zhang, Chuyang Wei, Maohang Gao, Xiawei Yue et al.
发布日期 2026-04-29
arXiv ID 2604.26733
相关性评分 9/10 (高度相关)