推理控制 信息不足 弃权机制 强化学习 安全 AI
摘要

本文指出大型推理模型在信息不足问题上的失效模式:虽能识别信息缺失,仍继续推理并产生无支持答案。我们将此形式化为“检测 - 弃权差距”。为此,提出“先判断后求解”(JTS)框架,将弃权视为控制决策,要求模型在生成解前明确承诺可答性。通过监督预热和基于缺失前提的强化学习,JTS 显著提升了可靠弃权率,使检测后的弃权率接近饱和,同时减少无效推理,提高推断效率。结果表明,信息不足下的弃权是安全高效部署推理模型的关键推理控制形式。

AI 推荐理由

论文核心研究推理模型在信息不足时的控制机制,提出新框架以优化推理过程中的弃权行为。

研究机构
1Fudan University 2Ant Group 3Zhejiang University 4Tsinghua University
论文信息
作者 Renjie Gu, Jiaxu Li, Yihao Wang, Yun Yue, Hansong Xiao et al.
发布日期 2026-05-27
arXiv ID 2605.28070
相关性评分 9/10 (高度相关)