摘要
工具增强的 LLM Agent 在部署时依赖跨步骤持久的运行时状态,但常见训练流程常忽略此语义。本文提出“不透明背包”任务,强制多轮控制流与状态修订,以隔离状态持久性作为训练变量。通过对比不同训练 - 运行组合,发现执行语义主要影响解决路径而非结果质量:状态错配会导致高频错误或令牌冗余。结论表明,解释器持久性应视为 Agent 轨迹的一级语义,对齐训练数据与部署运行时可显著提升效率并减少脆弱性。
AI 推荐理由
核心研究 Agent 运行时状态持久化(记忆)对训练和推理的影响及对齐机制。
研究机构
Ontocord
卡内基梅隆大学
MPI-IS Tubingen
图宾根AI中心
ELLIS Institute Tubingen
论文信息