RLVR Multiple-Choice Questions Reasoning Enhancement Distractor Design
摘要

可验证奖励强化学习(RLVR)显著提升了大语言模型的推理能力。多项选择题虽提供可扩展数据,但易引发奖励欺骗,导致模型通过猜测或排除法走捷径。现有方法常将其转为开放式问题,却丢失了专家设计干扰项的对比信号。本文系统研究了选项设计对 RLVR 的影响,发现训练与测试选项数量不匹配会降低性能,而强干扰项能有效抑制随机猜测。据此,我们提出迭代干扰项筛选框架,主动构建高质量干扰项以阻断捷径并促进深度推理。实验表明该方法显著提升了 RLVR 训练效果。

AI 推荐理由

论文核心研究通过选项设计优化 RLVR,旨在消除捷径并促进深度推理能力。

研究机构
上海AI实验室 上海创新研究院
论文信息
作者 Xu Guo, Qiming Ge, Jian Tong, Kedi Chen, Jin Zhang et al.
发布日期 2026-03-13
arXiv ID 2603.12826
相关性评分 9/10 (高度相关)