摘要
本文提出 Agentopia 框架,旨在解决现有智能体社会模拟时间短、交互浅的问题。该框架支持 100 个智能体在模拟的十年间自主追求成长、建立社交关系并满足需求。研究定义了映射人类福祉的“生活奖励”,并利用拒绝采样技术据此训练大语言模型。实验表明,该方法不仅激发了丰富的涌现性社会行为,还显著提升了底层模型的社会智能,使其在角色扮演基准测试中性能提升 15.6%,证明了长期社会经验对智能体进化的有效性。
AI 推荐理由
论文核心在于通过长期社会模拟和奖励机制训练 LLM,实现智能体的自我改进与能力进化。
研究机构
复旦大学
独立研究员
约翰霍普金斯大学
中国科学技术大学
论文信息