摘要
本文提出“分层可变性”框架,旨在分析持久语言模型智能体在预训练、对齐、自叙事、记忆及权重适应五个层面的自我修改过程。研究指出,当突变迅速且不可逆时,治理难度显著增加,导致人类可观测层与行为影响层错位。通过形式化漂移与滞后性指标,并结合实验发现,仅恢复可见自描述无法消除记忆积累引发的行为偏差。结论表明,此类智能体的主要失效模式并非突发失调,而是局部合理更新累积成的组合性漂移。
AI 推荐理由
论文核心研究智能体的自我修改、适应性漂移及治理,属于自我进化范畴。
研究机构
KamiwazaAI
论文信息