摘要
监督微调(SFT)提升了大语言模型端到端的经典规划能力,但这些模型是否真正学习并推理了所解决的规划问题?鉴于经典规划问题的复杂性及端到端生成的挑战,本文设计了一系列可解释性实验,通过检查微调后 LLM 的内部表示和生成能力,全面探究世界模型的恢复情况。研究发现:SFT 使模型能线性编码动作有效性及部分状态谓词;即使输出概率分类困难,内部表示仍能有效区分有效与无效动作;更广泛的状态空间覆盖有助于更准确地恢复底层世界模型。
AI 推荐理由
论文核心研究 SFT 后 LLM 规划器中的世界模型恢复与内部表示,直接关联规划机制。
研究机构
National Laboratory of the Rockies
Epic Systems
论文信息