摘要
社会模拟为研究社会智能提供了重要测试平台,但现有基于大语言模型的社交智能体多依赖静态人设,难以适应非平稳环境。本文提出 ALSO 框架,首次实现多智能体社会模拟中的在线策略优化。该方法将多轮交互建模为对抗性老虎机问题,并引入轻量级神经代理预测奖励,以支持样本高效探索与持续在线适应。实验表明,ALSO 在动态环境中显著优于静态基线及现有优化方法。
AI 推荐理由
论文提出在线策略优化框架,使 Agent 在非平稳环境中动态调整策略,属于自我进化核心研究。
研究机构
School of Artificial Intelligence, Tianjin University, Tianjin, China
The Chinese University of Hong Kong, Shenzhen, China
East China Normal University, Shanghai, China
Correspondence to: Zhongxiang Dai
论文信息