Long-Horizon Planning Autonomous Agents Strategy Evolution Retail Benchmark
摘要

针对大语言模型智能体在长程动态环境中难以保持连贯决策的挑战,本文提出了 RetailBench 基准,用于评估真实商业场景下的自主决策能力。文章进一步设计了“演化策略与执行”框架,将高层战略推理与低层动作执行分离,使策略能随环境变化自适应调整。实验表明,该框架在多种环境下提升了操作稳定性与效率,但也揭示了当前模型在处理复杂多因素长程决策时的根本局限。

AI 推荐理由

论文核心提出分层框架以解决长程任务中的策略规划与执行问题,显著提升决策稳定性。

研究机构
Ant Group City University of Hong Kong
论文信息
作者 Linghua Zhang, Jun Wang, Jingtong Wu, Zhisong Zhang
发布日期 2026-03-17
arXiv ID 2603.16453
相关性评分 9/10 (高度相关)