摘要
针对个人智能体在隐私、成本与能力间的矛盾,本文提出恒定上下文技能学习方法。该框架将可复用的工作流过程学习为轻量级任务模块,推理时仅依赖当前观测与紧凑状态块,而非冗长历史。通过确定性追踪器生成状态并对齐子目标奖励,利用步级监督微调与在线强化学习训练模块。实验表明,该方法在多个基准上性能优异,同时将每轮提示令牌数减少 2 至 7 倍,证实了将程序性上下文从提示迁移至权重的有效性。
AI 推荐理由
论文核心提出恒定上下文技能学习框架,将可复用过程转化为模型权重,显著优化技能执行效率。
研究机构
Arizona State University
论文信息