摘要
针对纯自主多智能体系统受限于静态知识导致的新任务脆弱性问题,本文提出人机循环协作框架(HILA)。该框架训练智能体学习元认知策略,以决定自主求解或求助人类专家。通过引入双环策略优化机制,内环利用成本感知奖励优化决策,外环实施持续学习,将专家反馈转化为监督信号以增强推理能力。实验表明,该方法在数学及复杂问题解决基准上显著优于现有先进多智能体系统,为构建可协作且持续进化的智能体系统奠定了理论基础。
AI 推荐理由
论文核心提出持续学习框架,利用人类反馈实现 Agent 能力的自我进化与策略优化。
研究机构
南加利福尼亚大学
论文信息