摘要
现实场景中的多智能体强化学习需适应打断当前行为且与长程目标冲突的自然语言指令。然而,将奖励条件化于指令会导致贝尔曼更新在不同指令上下文间耦合价值估计,引发宏动作中断时的价值不一致。本文提出 MAVIC 方法,通过在指令边界修正贝尔曼备份,校正传入指令目标并恢复当前目标下的延续价值。该方法直接修改自举目标而非重塑奖励,实现了随机指令切换下统一策略的一致价值估计。理论与实验表明,MAVIC 在复杂协作环境中既保证高指令依从性,又维持了基础任务性能。
AI 推荐理由
论文核心解决多智能体在长程目标下响应中断指令的规划一致性问题,涉及宏动作与价值修正。
研究机构
东北大学计算机科学系
论文信息