摘要
针对大语言模型在复杂推理任务中决策过程难以解释的问题,本文提出可信统一解释框架(TRUE)。该框架整合了可执行推理验证、可行区域有向无环图建模及因果失败模式分析。通过在实例级重新定义推理轨迹并进行盲执行验证,在局部结构级构建可行区域 DAG 以表征推理稳定性,以及在类别级识别 recurring 结构失败模式并量化其因果影响,实现了多层级、可验证的解释,显著提升了 LLM 推理系统的可解释性与可靠性。
AI 推荐理由
论文核心聚焦 LLM 推理过程的可解释性、稳定性验证及失败模式分析,直接针对推理机制。
研究机构
大连理工大学
论文信息