摘要
开发非协作对话代理传统上依赖手动且不可扩展的专家策略编码。本文提出 METRO 方法,利用大语言模型直接从原始转录中自主归纳策略动作与规划逻辑。该方法将专家知识形式化为“策略森林”这一分层结构,既捕捉短期响应节点,又涵盖长期战略预见分支。在两个基准测试中的实验结果表明,METRO 表现优异,平均超越现有方法 9%-10%。进一步分析揭示了其成功源于战略行为多样性与前瞻性,并证明了其强大的跨任务迁移能力,为低成本、可扩展地构建非协作代理提供了新见解。
AI 推荐理由
论文核心在于从对话中自动归纳策略动作与规划逻辑,构建分层策略森林以指导长期战略。
研究机构
新加坡国立大学计算科学学院
北京大学人工智能学院
四川大学计算机学院
北京先进计算创新中心未来区块链与隐私计算研究院
数学、信息与行为语义重点实验室(LMIB)
论文信息