摘要
大语言模型代理分为可强化学习的开源代理与仅能测试时控制的黑盒代理。针对黑盒代理无法进行参数优化的问题,本文利用强化学习与贝叶斯推断的等价性,提出代理蒙特卡洛(AMC)方法。该方法通过序列蒙特卡洛从最优策略后验中采样,学习价值函数引导代理行为,同时保持底层黑盒模型不变。在 AgentGym 基准上的实验表明,AMC 显著优于提示基线,并在扩展测试时计算量后超越组相对策略优化(GRPO),证明了黑盒代理进行原则性强化学习式优化的可行性。
AI 推荐理由
提出黑盒代理测试时优化框架,实现类 RL 自我改进,属核心进化机制研究。
研究机构
Layer 6 AI, Toronto, Canada
论文信息