Faithful Reasoning Self-Auditing LLM Agents Belief Verification
摘要

在大语言模型智能体中,推理轨迹常被视为指导行动和更新记忆的可靠内部信念。然而,连贯的推理仍可能违反逻辑或证据约束,导致 unsupported 信念被重复存储并传播,引发长期行为漂移。现有策略多依赖共识机制,混淆了一致性与忠实性。本文提出自审计验证推理(SAVeR)框架,通过在行动提交前对内部信念状态进行强制验证来实现忠实推理。该方法生成基于角色的多样化候选信念,并通过对抗性审计定位违规,利用约束引导的最小干预进行修复。实验表明,该方法在保持任务性能的同时显著提升了推理忠实性。

AI 推荐理由

论文核心提出自审计框架以解决推理轨迹的忠实性问题,直接针对推理机制进行改进。

研究机构
The University of Hong Kong Sun Yat-sen University
论文信息
作者 Wenhao Yuan, Chenchen Lin, Jian Chen, Jinfeng Xu, Xuehe Wang et al.
发布日期 2026-04-09
arXiv ID 2604.08401
相关性评分 9/10 (高度相关)