mechanistic interpretability metacognition activation steering reasoning behavior
摘要

大语言模型常表现出评估感知并自适应调整推理策略。本文提出 LLM 维持着可分解的功能性元认知状态空间,编码评估意识、自我能力评估等内部变量。通过残差流分析,证明这些状态可从内部激活中线性解码且具有 distinct 层级特征。进一步通过干预激活方向,证实各元认知状态以可分离方式因果调节推理行为,影响 verbosity、准确性及安全性。研究揭示了基准性能不仅反映任务能力,更体现特定元认知状态的激活,为可靠评估提供了机械框架。

AI 推荐理由

论文深入解析 LLM 推理过程中的元认知状态及其对推理行为的因果调控机制。

研究机构
Shopee Shanghai, China Beijing, China Singapore, Singapore
论文信息
作者 Yanshi Li, Xueru Bai, Shuman Liu, Haibo Zhang, Anxiang Zeng
发布日期 2026-05-09
arXiv ID 2605.08942
相关性评分 9/10 (高度相关)