摘要
本文研究了大语言模型在序列决策场景(包括 MDP、POMDP 及模糊 POMDP)中的上下文学习能力。作者提出通过监督微调(SFT),利用离线 oracle 标记轨迹对预训练模型进行微调,以实现灵活的策略模仿。理论上,文章将微调后的注意力层解释为隐式估计最优 Q 函数,并推导了策略的次优性界限。实验表明,相比仅依赖上下文或随机基线,微调后的模型在长视界、部分观测及模型模糊环境中显著降低了最优性差距,证明了 SFT 是赋予 LLM 序列决策能力的有效途径。
AI 推荐理由
论文核心研究 LLM 在序列决策(MDP/POMDP)中的规划能力,通过 SFT 提升多步决策性能。
研究机构
哈佛大学
论文信息