摘要
针对基于学习的机器人控制器通常在离线训练且参数固定,难以应对运行中不可预见变化的问题,本文提出了一种受生物启发的在线持续强化学习框架。该方法基于 DreamerV3 算法,利用世界模型预测残差检测分布外事件并自动触发微调。通过任务级性能信号和内部训练指标监控适应进度,无需外部监督即可评估收敛性。实验在多种连续控制任务及真实车辆上验证了该方法,展示了机器人智能体从静态训练向具备运行时自我反思与改进能力的自适应系统演进的可能性。
AI 推荐理由
论文核心在于在线持续学习与自适应机制,实现智能体在部署中的自我改进与反思。
研究机构
德国莱布尼茨大学自动化系统实验室 (ASL)
论文信息