Transformer 复杂性控制 推理与记忆 权重衰减 组合泛化
摘要

近期研究表明,Transformer 的组合泛化能力受复杂性控制(如初始化规模和权重衰减)支配,引导模型趋向低复杂度推理而非高复杂度记忆。然而,现有分析将复杂性控制视为静态超参数,未明确其起决定性作用的具体训练阶段。本文发现,Transformer 走向记忆还是推理的命运取决于一个尖锐且可识别的训练时间窗口。实验显示,仅在训练中期 25% 的窗口内应用权重衰减,其分布外准确率可与全程应用相当;若将正则化预算置于训练中期,效果远优于早期。该窗口边界极锐利,起始点微调即可导致性能剧变。此外,窗口位置依赖于初始化规模,小初始化反而缩小了推理解的吸引域。

AI 推荐理由

核心研究 Transformer 在训练中何时决定采用推理而非记忆机制,直接揭示推理能力的形成窗口。

研究机构
哥伦比亚大学, Irving 医疗中心,纽约,美国
论文信息
作者 Sarwan Ali
发布日期 2026-05-06
arXiv ID 2605.04396
相关性评分 9/10 (高度相关)