摘要
大型语言模型智能体常依赖冗长的低级文本动作序列,导致决策视界过长且推理成本高昂。本文提出潜在动作重参数化(LAR)框架,学习紧凑的潜在动作空间,其中每个潜在动作对应多步语义行为。通过将动作重参数化为潜在单元,LAR 在保持表达力的同时缩短了有效决策视界。与手工宏或分层控制器不同,潜在动作直接从轨迹中学习并集成到模型中,使规划与执行均基于抽象表示。实验表明,该方法显著减少了动作令牌和推理时间,同时维持或提升了任务成功率。
AI 推荐理由
论文提出潜在动作重参数化,通过抽象动作缩短决策视界,核心解决多步规划效率问题。
研究机构
Université de Montréal
The University of Sydney
Fudan University
Yale University
DeepWisdom
University of Illinois Urbana-Champaign
Amazon Science
Stanford University
The Hong Kong University of Science and Technology
Mila, Quebec AI Institute
Guangzhou
论文信息