摘要
针对大语言模型在高频决策任务中因状态频繁微小更新导致的性能局限及子任务与复合任务策略错位问题,本文提出归一化动作奖励引导的一致性策略优化(NAR-CP)方法。该方法首先通过奖励函数获取环境反馈的密集奖励并进行归一化重塑,理论上证明其不影响最优策略;其次利用 LLM 推断子观测候选动作生成联合策略,并通过一致性损失确保全局与子语义策略的精确对齐。无人机追逐实验表明,该方法在独立及复合任务中表现优异且具备良好泛化性。
AI 推荐理由
论文核心解决高频决策中的任务规划与策略对齐问题,提出新优化方法。
研究机构
西北工业大学人工智能学院(OPIE),中国
论文信息