In-Context Reinforcement Learning Generalist Agents Decision Pre-Trained Transformer Flow Matching Self-Adaptation
摘要

近期上下文强化学习(ICRL)进展展示了训练通用智能体在推理阶段直接获取新任务的潜力。本文扩展了决策预训练 Transformer(DPT),将其应用于多样化的多领域环境,并采用流匹配作为训练方法,保留了其贝叶斯后验采样的解释性。实验结果表明,该智能体在数百个任务上训练后,在未见测试集上展现出显著的泛化能力提升,优于先前的算法蒸馏缩放方案,证实了 ICRL 作为训练通用智能体的可行替代方案。

AI 推荐理由

论文核心研究上下文强化学习,使智能体在推理时自我适应新任务,属于自我进化范畴。

研究机构
Applied AI Institute Innopolis University HSE ITMO University NUST MISIS MSU Humanoid
论文信息
作者 Andrei Polubarov, Lyubaykin Nikita, Alexander Derevyagin, Artyom Grishin, Igor Saprygin et al.
发布日期 2026-04-06
arXiv ID 2604.05112
相关性评分 9/10 (高度相关)