摘要
构建高效可靠的策略对人机协作至关重要。现有方法或依赖多智能体强化学习导致黑盒不可解释,或因每步查询大语言模型而成本高昂。本文提出协作策略树(Co-pi-tree),一种闭环方法,通过将大语言模型的推理蒸馏为可执行代码来构建包含伙伴行为预测与智能体动作选择的策略树。该方法通过交互评估获取反馈,并利用自然语言总结以优化问题分支。Overcooked-AI 实验表明,该方法在平均奖励上提升 35.4%,同时大幅降低查询次数与延迟。
AI 推荐理由
论文核心在于将 LLM 的推理过程蒸馏为可解释策略树,直接针对推理能力的转化与应用。
研究机构
Sun Yat-sen University
论文信息