摘要
针对生成式 AI 在连续控制任务中面临的上下文限制及缺乏显式奖励信号等挑战,本文提出一种新颖的无奖励自微调框架。该框架使智能体通过与环境直接交互持续学习,利用双视角反思机制生成自主语言反馈以构建偏好数据集,并将长程经验蒸馏至模型参数中,而非依赖提示记忆。在动态无线接入网(RAN)切片任务上的实验表明,该方法在样本效率、稳定性及多目标优化方面优于传统强化学习基线及现有大模型智能体,展现了自进化智能体在连续控制领域的潜力。
AI 推荐理由
论文提出无奖励自微调框架,通过双视角反思机制实现智能体持续自我改进与经验内化。
研究机构
华东师范大学计算机科学与技术学院
论文信息