self-modifying agents governance compositional drift temporal identity
摘要

本文提出“分层可变性”框架,旨在分析持久语言模型智能体在预训练、对齐、自叙事、记忆及权重适应五个层面的自我修改过程。研究指出,当突变迅速且不可逆时,治理难度显著增加,导致人类可观测层与行为影响层错位。通过形式化漂移与滞后性指标,并结合实验发现,仅恢复可见自描述无法消除记忆积累引发的行为偏差。结论表明,此类智能体的主要失效模式并非突发失调,而是局部合理更新累积成的组合性漂移。

AI 推荐理由

论文核心研究智能体的自我修改、适应性漂移及治理,属于自我进化范畴。

研究机构
KamiwazaAI
论文信息
作者 Krti Tallam
发布日期 2026-04-16
arXiv ID 2604.14717
相关性评分 9/10 (高度相关)