摘要
近期上下文强化学习(ICRL)进展展示了训练通用智能体在推理阶段直接获取新任务的潜力。本文扩展了决策预训练 Transformer(DPT),将其应用于多样化的多领域环境,并采用流匹配作为训练方法,保留了其贝叶斯后验采样的解释性。实验结果表明,该智能体在数百个任务上训练后,在未见测试集上展现出显著的泛化能力提升,优于先前的算法蒸馏缩放方案,证实了 ICRL 作为训练通用智能体的可行替代方案。
AI 推荐理由
论文核心研究上下文强化学习,使智能体在推理时自我适应新任务,属于自我进化范畴。
研究机构
Applied AI Institute
Innopolis University
HSE
ITMO University
NUST MISIS
MSU
Humanoid
论文信息