摘要
基于规则的奖励为将大语言模型强化学习扩展至非自动验证任务提供了新途径,但现有方法依赖专家编写规则和手动构建问题集,且固定规则难以适配个体问题。本文提出 ARES 框架,能从原始预训练文档中自动生成包含问题 - 答案对及特定问题加权规则的强化学习数据,实现开放式回答的实例级奖励监督。该框架通过领域标签和角色信息提升多样性,并应用多重验证过滤。实验表明,基于 ARES 训练的模型在多维开放任务上显著优于持续预训练、监督微调及二元奖励强化学习。
AI 推荐理由
论文提出自动化构建强化学习数据框架,通过自我生成规则实现模型自我改进与扩展,属核心进化研究。
研究机构
University of Science and Technology of China
National University of Singapore
Alibaba Group
论文信息