摘要
本文研究了仅解码器 Transformer 模型在上下文学习中执行抽象符号推理(特别是命题逻辑)的能力。针对现有模型难以泛化至训练未见的变量名这一问题,作者从理论和实证角度揭示了一种关键的“表示坍缩”现象:未见令牌的非嵌入向量在训练中坍缩为近乎相同的向量,导致模型难以区分它们。基于此机制解释,论文提出结合架构微调、数据多样性及冻结或重置非嵌入参数的组合策略,成功实现了对未见令牌的泛化。此外,研究还在 Gemma 3 系列开源模型中观察到了类似现象。
AI 推荐理由
论文核心研究 Transformer 在符号逻辑推理中的泛化机制,提出表示坍缩理论并验证。
研究机构
Gemma Team
论文信息