摘要
近期软提示研究试图通过在输入中插入训练向量来提升推理能力,但尚未区分增益源于学习内容还是注入行为本身。本文研究随机软提示(RSP),完全省略训练步骤,仅将随机采样的嵌入向量序列附加到输入中。尽管不含学习内容,RSP 在多项数学推理基准上达到了与优化软提示相当的准确率。其机制分为两阶段:注意力机制吸收未见过的随机位置导致早期生成分布扁平化及推理轨迹分支,随后影响自然稀释以锁定单一结果。研究表明 RSP 结合温度采样可显著提升 Pass@N 指标,并将此效应扩展至 DAPO 训练中取得实际增益。
AI 推荐理由
论文核心研究通过随机嵌入注入提升 LLM 数学推理能力,直接针对推理机制。
研究机构
Gwangju Institute of Science and Technology
Microsoft Research
论文信息