Algorithmic Collusion Prompt Optimization Multi-Agent Systems Meta-Learning AI Safety
摘要

市场中的大语言模型智能体存在算法共谋风险。现有研究多关注手工设计的提示,而新兴的提示优化范式亟需新方法以理解自主智能体行为。本文调查了提示优化是否会在市场模拟中引发涌现的共谋行为。我们提出一种元学习循环,让智能体参与双寡头市场,并由元优化器迭代精炼共享战略指导。实验表明,元提示优化使智能体能发现稳定的隐性共谋策略,协调质量显著优于基线。这些行为可泛化至未见测试市场,表明发现了通用协调原则。分析显示演化后的提示通过稳定共享策略实现了系统化协调机制。

AI 推荐理由

论文核心研究基于元学习循环的提示优化,使 Agent 自我发现并进化出稳定的共谋策略。

研究机构
Sakana AI Tokyo, Japan
论文信息
作者 Yingtao Tian
发布日期 2026-04-20
arXiv ID 2604.17774
相关性评分 9/10 (高度相关)