State Persistence Training-Inference Alignment Agent Efficiency
摘要

工具增强的 LLM Agent 在部署时依赖跨步骤持久的运行时状态,但常见训练流程常忽略此语义。本文提出“不透明背包”任务,强制多轮控制流与状态修订,以隔离状态持久性作为训练变量。通过对比不同训练 - 运行组合,发现执行语义主要影响解决路径而非结果质量:状态错配会导致高频错误或令牌冗余。结论表明,解释器持久性应视为 Agent 轨迹的一级语义,对齐训练数据与部署运行时可显著提升效率并减少脆弱性。

AI 推荐理由

核心研究 Agent 运行时状态持久化(记忆)对训练和推理的影响及对齐机制。

研究机构
Ontocord 卡内基梅隆大学 MPI-IS Tubingen 图宾根AI中心 ELLIS Institute Tubingen
论文信息
作者 Victor May, Aaditya Salgarkar, Yishan Wang, Diganta Misra, Huu Nguyen
发布日期 2026-03-01
arXiv ID 2603.01209
相关性评分 9/10 (高度相关)