摘要
本文提出了一种新的架构变更及后训练流程,旨在通过教导模型提前截断前向传播,使其成为更详尽的推理者。我们在现有 Transformer 架构中增加了中间层的早期退出机制,训练模型在无需深度计算即可预测下一令牌时从较浅层退出。经校准后,利用强化学习激励模型在保持任务性能的同时尽早退出。初步结果显示,小型推理模型学会了自适应地减少各令牌的计算量。该方法有望最小化推理模型的冗余计算,仅将内部激活用于难预测令牌的非短视规划。
AI 推荐理由
提出架构变更以激励外部化推理,核心聚焦于优化 LLM 的推理计算机制。
研究机构
MARS
University of Amsterdam
Geodesic Research
论文信息