摘要
现代基于大语言模型的智能体已超越被动文本生成,涉及工具调用、记忆维护及多智能体协作。本文指出,此类系统常出现“约束漂移”现象,即安全关键约束在经由记忆、委托、通信等环节时发生丢失或弱化。作者主张安全行为需在整个执行轨迹中持续维持,而非仅在输出端断言。为此,论文提出“约束状态治理”新范式,将安全约束作为显式执行状态进行管理,并结合约束原生强化学习,确保智能体在安全边界内提升效用。
AI 推荐理由
论文核心探讨约束在记忆传递中的漂移,提出将约束作为显式执行状态维护的机制。
研究机构
University of Liverpool, UK
University of Nottingham, UK
University of Exeter, UK
University of Tokyo, Japan
论文信息