摘要
在大语言模型强化微调中,课程学习能提升效率与性能,但现有方法依赖外部启发式或辅助模型,易与策略训练动态错位。本文提出 METIS 框架,将课程判断内化为原生能力。利用提示内奖励方差衡量信息量,METIS 基于近期训练结果预测该指标,动态分配训练资源。通过联合优化标准奖励与自我判断奖励,实现“学会学什么”的元认知闭环。在数学推理、代码生成及智能体函数调用等基准测试中,METIS 显著提升性能并加速收敛高达 67%。
AI 推荐理由
论文提出元认知自我判断机制,使模型自主决定学习路径,属于典型的自我进化与自适应研究。
研究机构
MIT
Amazon AGI
论文信息