Strategy Induction Non-collaborative Dialogue Planning Logic LLM Agents
摘要

开发非协作对话代理传统上依赖手动且不可扩展的专家策略编码。本文提出 METRO 方法,利用大语言模型直接从原始转录中自主归纳策略动作与规划逻辑。该方法将专家知识形式化为“策略森林”这一分层结构,既捕捉短期响应节点,又涵盖长期战略预见分支。在两个基准测试中的实验结果表明,METRO 表现优异,平均超越现有方法 9%-10%。进一步分析揭示了其成功源于战略行为多样性与前瞻性,并证明了其强大的跨任务迁移能力,为低成本、可扩展地构建非协作代理提供了新见解。

AI 推荐理由

论文核心在于从对话中自动归纳策略动作与规划逻辑,构建分层策略森林以指导长期战略。

研究机构
新加坡国立大学计算科学学院 北京大学人工智能学院 四川大学计算机学院 北京先进计算创新中心未来区块链与隐私计算研究院 数学、信息与行为语义重点实验室(LMIB)
论文信息
作者 Haofu Yang, Jiaji Liu, Chen Huang, Faguo Wu, Wenqiang Lei et al.
发布日期 2026-04-13
arXiv ID 2604.11427
相关性评分 9/10 (高度相关)