recursive loops context management attractor dynamics LLM safety
摘要

本研究探讨了递归语言模型循环中的吸引子模式,重点分析注入多少文本能改变循环状态及其持久性。通过对比附加、替换和对话三种上下文更新规则,发现附加模式下的持续重定向高度依赖于记忆策略。在全历史协议下,大量令牌注入可实现高比例的状态逃逸与保持。研究指出,上下文更新规则是关乎安全的关键设计选择,评估时需区分瞬态移动与持久逃逸,并扣除随机基线影响。

AI 推荐理由

论文核心研究递归循环中上下文更新规则(记忆策略)对状态持久性和逃逸的影响。

研究机构
Kaplanski Ai Lab
论文信息
作者 Pawel Kaplanski
发布日期 2026-05-04
arXiv ID 2605.02236
相关性评分 9/10 (高度相关)