Distributional Reasoning Reinforcement Learning Uncertainty Estimation Multi-answer Generation
摘要

针对语言模型后训练常将答案分布坍缩为单一众数的问题,本文提出一种多答案强化学习方法,旨在训练模型在推理时进行分布推理。该方法修改了 RL 目标,使模型能在单次前向传播中显式生成多个候选答案及置信度,将推理时搜索内化至生成过程。在问答、医疗诊断和编码基准测试中,该方法相比单答案基线显著提升了多样性、覆盖率和校准度,且生成多答案所需令牌更少,在编码任务上准确率更高,为推理时扩展提供了高效替代方案。

AI 推荐理由

论文提出分布推理新范式,利用 RL 让模型单次前向生成多假设,核心提升推理能力。

研究机构
Massachusetts Institute of Technology
论文信息
作者 Isha Puri, Mehul Damani, Idan Shenfeld, Marzyeh Ghassemi, Jacob Andreas et al.
发布日期 2026-03-25
arXiv ID 2603.24844
相关性评分 9/10 (高度相关)