摘要
多轮多智能体 LLM 游戏评估常存在显著的运行间方差,长程交互中的微小偏差会因多智能体耦合而放大,导致胜率估计有偏且排名不可靠。本文提出 MEMO(记忆增强模型上下文优化),一种通过耦合保留与探索来优化推理时上下文的自博弈框架。保留机制维护持久记忆库,存储自博弈轨迹的结构化洞察并在后续游戏中作为先验注入;探索机制结合 TrueSkill 进行不确定性感知的提示演化,并利用优先重放 revisit 罕见关键状态。实验表明,MEMO 显著提升了胜率并降低了方差,尤其在谈判和不完全信息游戏中表现优异。
AI 推荐理由
论文核心提出 MEMO 框架,通过持久化记忆库存储结构化洞察并注入先验,显著优化多智能体上下文。
研究机构
莱斯大学
A*STAR
德克萨斯大学奥斯汀分校
普林斯顿大学
Good Start Labs
论文信息