摘要
社交智能是语言智能体面临的核心挑战,其强化学习训练需解决信用分配问题。现有方法缺乏理论依据且仅具回顾性。本文提出 SAVOIR 框架,基于合作博弈论,结合期望效用将评估转向前瞻性估值,并利用 Shapley 值确保公平的信用分配。在 SOTOPIA 基准上的实验表明,该方法性能达到最先进水平,7B 模型表现媲美或超越 GPT-4o 等专有模型,证明社交智能需要不同于分析推理的独特能力。
AI 推荐理由
提出基于博弈论的奖励归因框架,通过强化学习实现智能体社交能力的自我改进与进化。
研究机构
香港大学
论文信息