摘要
强化学习在现实应用中日益普及,但多数系统遵循“先训练后固定”范式,部署后停止学习直至性能下降需重训。本文提出,只要代理接收评估奖励信号,其部署本质即为持续强化学习问题。我们识别了部署后导致非平稳性的四大来源,强调最优代理必须永不停止适应。通过分析现实成功案例,本文阐述了摒弃现有范式的优势及具体措施,倡导建立持续进化的智能体系统。
AI 推荐理由
论文主张部署后持续学习与自适应,核心探讨 Agent 自我进化机制。
研究机构
Equal contribution, ordered alphabetically. Alberta Machine Intelligence Institute (Amii), Edmonton, Canada
论文信息