Reinforcement Learning Code LLM Multi-Task Learning Utility-Guided
摘要

针对现有代码大语言模型多任务强化学习方法统一处理所有任务、依赖固定课程导致效率受限的问题,本文提出 ASTOR 框架。该框架以任务效用为核心,包含分层效用路由数据调度模块和自适应效用校准策略优化模块。前者动态分配训练预算并优先选择高价值数据,后者根据任务状态调整正则化约束。实验表明,ASTOR 在多个编码任务上显著优于专用模型及现有多任务基线。

AI 推荐理由

论文核心研究代码 LLM 的多任务强化学习框架,直接提升编码技能。

研究机构
Harbin Institute of Technology, Shenzhen Huawei Cloud Computing Technologies Co., Ltd.
论文信息
作者 Yujia Chen, Yang Ye, Xiao Chu, Yuchi Ma, Cuiyun Gao
发布日期 2026-05-07
arXiv ID 2605.06111
相关性评分 9/10 (高度相关)