可解释性 推理验证 因果分析 LLM 可靠性
摘要

针对大语言模型在复杂推理任务中决策过程难以解释的问题,本文提出可信统一解释框架(TRUE)。该框架整合了可执行推理验证、可行区域有向无环图建模及因果失败模式分析。通过在实例级重新定义推理轨迹并进行盲执行验证,在局部结构级构建可行区域 DAG 以表征推理稳定性,以及在类别级识别 recurring 结构失败模式并量化其因果影响,实现了多层级、可验证的解释,显著提升了 LLM 推理系统的可解释性与可靠性。

AI 推荐理由

论文核心聚焦 LLM 推理过程的可解释性、稳定性验证及失败模式分析,直接针对推理机制。

研究机构
大连理工大学
论文信息
作者 Yujiao Yang
发布日期 2026-02-21
arXiv ID 2602.18905
相关性评分 9/10 (高度相关)