摘要
针对现有基于大语言模型的强化学习方法存在标注成本高、模型崩溃或奖励欺骗等问题,本文受认知学习理论启发,提出 EasyRL 方法。该方法模拟人类认知习得曲线,结合少量简单标注数据的可靠知识迁移与渐进式分治策略处理难例无标签数据。具体包括:利用少样本监督强化学习初始化模型,采用基于一致性的选择和基于反思的解决策略进行伪标签生成,最后通过难度渐进的自训练进一步增强推理能力。实验表明,仅用 10% 简单标注数据,该方法在数学与科学基准上均优于最先进基线。
AI 推荐理由
论文提出自我进化框架 EasyRL,核心在于通过课程学习和强化学习实现模型能力的自主迭代提升。
研究机构
北京大学
上海人工智能实验室
南开大学
威斯康星大学麦迪逊分校
论文信息