摘要
针对深度强化学习依赖人工设计奖励函数及反复调优的问题,本文提出 AgenticRL 框架。该框架利用多模态生成式预训练 Transformer 代理解读任务与视觉信息,自动生成特定任务奖励函数,并通过 PPO 算法训练策略。代理充当评论家,通过诊断包评估策略并生成反馈,识别失败模式以在闭环中自我精炼奖励函数。推理阶段,代理根据实时图像和自然语言自动选择最佳策略。实验表明,闭环精炼使策略行为提升 71%,实机部署成功率达 91%,实现了高效的模拟到现实迁移。
AI 推荐理由
论文核心提出闭环自我改进机制,Agent 自动诊断失败并优化奖励函数,实现策略自我进化。
论文信息