摘要
下一代自主代理不仅需高效学习,更须在开放世界中可靠行动并适应行为变化。针对现有方法局限于固定任务的不足,本文提出基础世界模型愿景:一种融合强化学习、反应式程序合成与抽象机制的持久化组合表示。该框架包含可学习奖励模型、自适应形式化验证、在线抽象校准及验证引导的测试时合成四大组件,旨在使代理能从少量交互中推导新策略,并在适应新颖性时保持正确性与可解释性。
AI 推荐理由
论文核心聚焦于 Agent 在动态环境中的自我进化、策略适应及持续学习机制。
研究机构
AI Lab, Vrije Universiteit Brussel & Flanders Make
比利时布鲁塞尔
论文信息