Reinforcement Learning Self-Improvement UAV Navigation Multimodal Agent Sim-to-Real
摘要

针对深度强化学习依赖人工设计奖励函数及反复调优的问题,本文提出 AgenticRL 框架。该框架利用多模态生成式预训练 Transformer 代理解读任务与视觉信息,自动生成特定任务奖励函数,并通过 PPO 算法训练策略。代理充当评论家,通过诊断包评估策略并生成反馈,识别失败模式以在闭环中自我精炼奖励函数。推理阶段,代理根据实时图像和自然语言自动选择最佳策略。实验表明,闭环精炼使策略行为提升 71%,实机部署成功率达 91%,实现了高效的模拟到现实迁移。

AI 推荐理由

论文核心提出闭环自我改进机制,Agent 自动诊断失败并优化奖励函数,实现策略自我进化。

论文信息
作者 Roohan Ahmed Khan, Yasheerah Yaqoot, Muhammad Ahsan Mustafa, Dzmitry Tsetserukou
发布日期 2026-06-02
arXiv ID 2606.03963
相关性评分 9/10 (高度相关)