摘要
本研究探讨了语言模型中规划位点的形成机制,即结构约束的未来 token 内部表征在前向传播中的产生位置及其是否因果驱动生成过程。以押韵对联补全作为前瞻性约束的纯净测试,我们在三种模型家族(Qwen3、Gemma-3、Llama-3)的十多个尺度上应用了线性探测和激活修补两种轻量级方法。探测结果显示,未来押韵信息在行边界处可线性解码,且信号强度随模型规模增加而增强。激活修补揭示,仅 Gemma-3-27B 因果依赖此编码,表现出因果驱动从押韵词迁移至行边界的交接现象;其他模型则在整个生成过程中条件依赖于押韵词,尽管存在强探测信号,但在行边界处因果效应近乎为零。
AI 推荐理由
论文核心研究 LLM 内部规划表征的形成位置及因果驱动机制,直接探讨规划本质。
研究机构
Stanford University
论文信息