摘要
大型语言模型(LLM)已被提议作为航天器操作的监督代理,但现有方法依赖静态提示,无法在重复执行中改进。本文引入 GUIDE,这是一种非参数策略改进框架,无需更新权重即可通过进化结构化、状态条件的自然语言决策规则手册,实现跨回合自适应。轻量级执行模型负责实时控制,而离线反思则利用先前的轨迹更新规则手册。在坎巴拉太空计划微分游戏环境中的对抗性轨道拦截任务评估表明,GUIDE 的进化机制持续优于静态基线。结果表明,LLM 代理中的上下文进化实质上是在实时闭环航天器交互中对结构化决策规则进行的策略搜索。
AI 推荐理由
论文提出非参数策略改进框架,核心在于通过离线反思进化决策规则库,实现跨回合自适应。
研究机构
Massachusetts Institute of Technology
Cambridge, USA
论文信息