摘要
可验证奖励强化学习(RLVR)在训练推理导向大语言模型方面效果显著,但现有方法多假设高资源场景。在低资源情境下,RLVR 易发生严重的熵坍缩,限制探索并降低推理性能。为此,本文提出混合域熵动态对齐(HEAL)框架。该框架首先选择性引入高价值通用域数据以促进多样化探索;其次提出熵动态对齐(EDA)奖励机制,对齐目标域与通用域的轨迹级熵动态,捕捉熵的大小及细粒度变化。实验表明,HEAL 在多个领域显著提升少样本 RLVR 性能,仅用 32 个样本即可媲美或超越千样本全量训练效果。
AI 推荐理由
论文核心解决低资源下推理模型训练的熵坍缩问题,直接提升推理性能。
研究机构
厦门大学信息科学与技术学院
厦门大学_Unisound Intelligence Technology Co., Ltd
论文信息