摘要
LLM Agent 的表现不仅取决于语言模型,还受介导观察、工具使用及轨迹控制的运行时 Harness 影响。针对现有方法主要更新模型参数的问题,本文提出 Life-Harness,一种感知生命周期的运行时 Harness。它无需改变模型权重或评估环境,通过将训练轨迹中的重复交互失败转化为可重用的干预措施,在环境契约、程序技能及轨迹调节等方面实现进化。实验表明,该方法在多个确定性环境中显著提升了不同模型 backbone 的性能,证明了运行时接口自适应作为模型中心训练补充方案的有效性。
AI 推荐理由
论文提出 Life-Harness,通过演化运行时接口实现 Agent 自我改进,核心聚焦自适应与进化机制。
研究机构
北京大学
论文信息