Strategic Reasoning Multi-agent Systems Policy Optimization Foresight Modeling
摘要

尽管大语言模型的推理能力显著提升,但在多智能体环境中因缺乏明确的前瞻性建模,难以进行有效决策。本文引入战略性推理以预测对手行为及未来动作,并提出前瞻策略优化(FoPO)方法。该方法将对手建模原则融入策略优化,显式考虑自身利益与对手影响。通过在合作与竞争数据集上的自博弈实验,证明 FoPO 显著提升了不同规模模型的战略推理能力及跨域泛化性能,优于现有基准。

AI 推荐理由

论文核心提出 FoPO 方法以增强大模型的战略推理与前瞻性建模能力。

研究机构
香港理工大学计算机系 香港理工大学计算机科学与技术学院 苹果公司设计部
论文信息
作者 Jiashuo Wang, Jiawen Duan, Jian Wang, Kaitao Song, Chunpu Xu et al.
发布日期 2026-04-15
arXiv ID 2604.13592
相关性评分 9/10 (高度相关)