摘要
针对可验证奖励强化学习(RLVR)在挑战性数学问题上虽提升低 k 值准确率却导致解空间覆盖收窄的问题,本文提出两种新机制:分布对齐提示合成(DAHS)构建基于学生风格响应的教师提示,以解决师生分布不匹配;反向提示退火(BHA)则在训练中逐步减少提示暴露并保留无提示更新。实验表明,该方法在多个 AIME 基准上显著提升了 Qwen 和 Llama 模型的 pass@1 及大 k 值表现,证实了提示支架在恢复早期可学习性及适时移除方面的有效性。
AI 推荐理由
论文核心解决数学推理中的分布锐化问题,通过提示合成与退火提升推理准确率。
研究机构
CyCraft AI Lab, Taiwan
论文信息