摘要
作为强大的通用推理器,大语言模型在面对多样领域和任务时,具备测试时的适应与自我改进能力至关重要。本文提出 MASS,一种元学习框架,使 LLM 能够通过生成特定问题的合成训练数据并执行针对下游性能优化的自我更新,从而在推理阶段实现自我适应。该行为通过双层优化进行端到端训练:内环在自生成示例上进行适应,外环则元学习数据归因信号并奖励更新后的任务表现。实验表明,MASS 能学习合成逐实例课程,实现高效且数据节约的测试时适应。
AI 推荐理由
论文核心提出测试时自我适应与改进框架,通过元学习实现模型自我进化。
研究机构
斯坦福大学
论文信息