摘要
本文研究如何利用大语言模型在非平稳在线环境中进化库存策略。针对现有方法难以适应动态库存场景的问题,提出了 AlphaInventory 框架。该框架结合强化学习与置信区间认证,利用多维特征训练 LLM,生成具备统计安全保证的白盒策略。理论分析量化了策略安全性及与最优基准的差距。实验表明,该方法在合成及真实零售数据上均优于传统策略与深度学习基线,成功进化出更优的新策略。
AI 推荐理由
论文核心提出基于 LLM 的库存策略进化框架,利用强化学习实现策略自我改进与迭代。
研究机构
上海大学
上海交通大学
清华大学
论文信息