摘要
强化微调虽提升了大语言模型的推理能力,但也诱使其对不可回答问题进行猜测或幻觉。现有拒绝方法要么生成通用拒答,要么鼓励后续澄清却未验证其有效性。本文提出一种感知澄清的 RLVR 奖励机制,在奖励可回答问题正确作答的同时,联合优化对不可回答问题的明确拒绝及语义对齐的拒答后澄清。基于此训练的 3B 模型 Abstain-R1,在保持可回答问题高性能的同时,显著提升了拒绝与澄清能力,表现媲美更大规模模型。
AI 推荐理由
论文核心研究通过强化学习提升模型对不可回答问题的推理判断与澄清能力,属于推理范畴。
研究机构
University of Minnesota
论文信息