摘要
尽管大语言模型的推理能力显著提升,但在多智能体环境中因缺乏明确的前瞻性建模,难以进行有效决策。本文引入战略性推理以预测对手行为及未来动作,并提出前瞻策略优化(FoPO)方法。该方法将对手建模原则融入策略优化,显式考虑自身利益与对手影响。通过在合作与竞争数据集上的自博弈实验,证明 FoPO 显著提升了不同规模模型的战略推理能力及跨域泛化性能,优于现有基准。
AI 推荐理由
论文核心提出 FoPO 方法以增强大模型的战略推理与前瞻性建模能力。
研究机构
香港理工大学计算机系
香港理工大学计算机科学与技术学院
苹果公司设计部
论文信息