LLM Evolutionary Search Inventory Management Reinforcement Learning Safety Guarantees
摘要

本文研究如何利用大语言模型在非平稳在线环境中进化库存策略。针对现有方法难以适应动态库存场景的问题,提出了 AlphaInventory 框架。该框架结合强化学习与置信区间认证,利用多维特征训练 LLM,生成具备统计安全保证的白盒策略。理论分析量化了策略安全性及与最优基准的差距。实验表明,该方法在合成及真实零售数据上均优于传统策略与深度学习基线,成功进化出更优的新策略。

AI 推荐理由

论文核心提出基于 LLM 的库存策略进化框架,利用强化学习实现策略自我改进与迭代。

研究机构
上海大学 上海交通大学 清华大学
论文信息
作者 Chenyu Huang, Jianghao Lin, Zhengyang Tang, Bo Jiang, Ruoqing Jiang et al.
发布日期 2026-05-01
arXiv ID 2605.00369
相关性评分 9/10 (高度相关)