摘要
模式引导的推理流程要求大语言模型在做出最终决策前生成明确的中间结构(如评分标准、检查清单)。本文提出一种因果评估协议,通过确定性函数映射验证这些结构是否真正决定输出。实验发现,尽管模型看似自洽,但在中间结构被干预后,高达 60% 的案例未能更新预测,表明其忠实度脆弱。若将推导过程委托给外部工具,该问题可大幅缓解。研究表明,中间结构更多是作为有影响力的上下文,而非稳定的因果中介。
AI 推荐理由
论文核心研究 LLM 在推理过程中对中间结构的因果忠实度,直接关乎推理机制的可靠性。
研究机构
AIRI
MIPT
ISP RAS Research Center for Trusted AI
论文信息