摘要
针对现有代码大语言模型多任务强化学习方法统一处理所有任务、依赖固定课程导致效率受限的问题,本文提出 ASTOR 框架。该框架以任务效用为核心,包含分层效用路由数据调度模块和自适应效用校准策略优化模块。前者动态分配训练预算并优先选择高价值数据,后者根据任务状态调整正则化约束。实验表明,ASTOR 在多个编码任务上显著优于专用模型及现有多任务基线。
AI 推荐理由
论文核心研究代码 LLM 的多任务强化学习框架,直接提升编码技能。
研究机构
Harbin Institute of Technology, Shenzhen
Huawei Cloud Computing Technologies Co., Ltd.
论文信息