摘要
大语言模型常表现出评估感知并自适应调整推理策略。本文提出 LLM 维持着可分解的功能性元认知状态空间,编码评估意识、自我能力评估等内部变量。通过残差流分析,证明这些状态可从内部激活中线性解码且具有 distinct 层级特征。进一步通过干预激活方向,证实各元认知状态以可分离方式因果调节推理行为,影响 verbosity、准确性及安全性。研究揭示了基准性能不仅反映任务能力,更体现特定元认知状态的激活,为可靠评估提供了机械框架。
AI 推荐理由
论文深入解析 LLM 推理过程中的元认知状态及其对推理行为的因果调控机制。
研究机构
Shopee
Shanghai, China
Beijing, China
Singapore, Singapore
论文信息