Multi-Agent Simulation Self-Improvement Social Intelligence Long-Term Learning
摘要

本文提出 Agentopia 框架,旨在解决现有智能体社会模拟时间短、交互浅的问题。该框架支持 100 个智能体在模拟的十年间自主追求成长、建立社交关系并满足需求。研究定义了映射人类福祉的“生活奖励”,并利用拒绝采样技术据此训练大语言模型。实验表明,该方法不仅激发了丰富的涌现性社会行为,还显著提升了底层模型的社会智能,使其在角色扮演基准测试中性能提升 15.6%,证明了长期社会经验对智能体进化的有效性。

AI 推荐理由

论文核心在于通过长期社会模拟和奖励机制训练 LLM,实现智能体的自我改进与能力进化。

研究机构
复旦大学 独立研究员 约翰霍普金斯大学 中国科学技术大学
论文信息
作者 Xintao Wang, Sirui Zheng, Hongqiu Wu, Weiyuan Li, Jen-tse Huang et al.
发布日期 2026-06-05
arXiv ID 2606.07513
相关性评分 9/10 (高度相关)