摘要
并行大语言模型测试时扩展技术(如 Best-of-N)需基于同一提示生成多个序列。传统方法中各序列独立生成,无法复用中间结果。本文提出 LaneRoPE,旨在生成阶段实现多序列间的协调与协作。其核心包括:(a) 序列间注意力掩码,使序列采样相互依赖;(b) 扩展 RoPE 以注入捕捉序列内外令牌相对位置的位置信息。在数学推理任务上的评估显示,LaneRoPE 促进了序列间协作,在有限生成长度下显著提升了准确率,且推理开销极低。
AI 推荐理由
论文提出 LaneRoPE 以增强并行序列间的协作推理,直接提升数学推理任务准确率。
研究机构
Qualcomm AI Research
论文信息