摘要
本文指出测试时强化学习(TTRL)在数学推理基准上的增益常被误读,实为对已可解问题的 sharpening,且多数投票易将正确答案不可逆地锁死为错误。作者发现低能力问题中存在短暂的“正确答案消亡窗口”,并提出 TTRL-Guard 框架。该框架包含翻转率感知奖励缩放、少数派保留采样及风险条件稀疏更新三种机制,旨在保护潜在的正确信号。实验表明,该方法在多个模型与基准上显著优于原有 TTRL 方法。
AI 推荐理由
论文聚焦测试时强化学习提升数学推理能力,核心解决推理过程中的错误锁定问题。
研究机构
Meituan
论文信息