abstention reasoning trace hallucination detection query misalignment
摘要

针对大语言模型(尤其是推理模型)在复杂任务中拒答能力不足的问题,本文提出“查询错位框架”。该框架将导致未能拒答的幻觉重新解释为模型回答了错误的问题。基于此,开发了名为“轨迹反转”的新方法:首先生成模型的推理轨迹,仅凭该轨迹重构模型最可能响应的问题,最后对比原始问题与重构问题的相似度。低相似度表明模型可能回答错误并触发拒答。实验表明,该方法在多个前沿模型和数据集上显著提升了拒答性能。

AI 推荐理由

论文核心基于推理轨迹分析模型是否答非所问,直接利用推理过程提升拒答能力。

研究机构
IBM Research MIT-IBM Watson AI Lab
论文信息
作者 Abinitha Gourabathina, Inkit Padhi, Manish Nagireddy, Subhajit Chaudhury, Prasanna Sattigeri
发布日期 2026-04-02
arXiv ID 2604.02230
相关性评分 9/10 (高度相关)