摘要
大型语言模型展现出强大的推理能力,现有方法日益成熟,研究重心转向元推理。然而,多数现有方法仅关注单实例内的复杂元推理流程,忽视了跨实例可复用元推理技能的积累,导致重复失败和高昂的认知成本。本文提出“元认知巩固”框架,将过往推理经验转化为可复用知识以提升未来表现。该框架通过划分推理、监控与控制角色生成丰富的元级轨迹,并利用分层多时间尺度更新机制逐步演化元知识。实验表明,随着经验积累,模型性能在各基准上持续提升。
AI 推荐理由
论文提出元认知巩固框架,实现跨实例经验积累与自我改进,核心聚焦 Agent 自我进化。
研究机构
东南大学
King's College London
中国科学院大学
论文信息