Chain-of-Thought Dynamic Abstention Reinforcement Learning Compute Efficiency
摘要

大语言模型在使用思维链推理时,常因生成长且错误的响应而浪费大量计算资源。弃权机制可通过抑制低概率正确的输出来缓解此问题。现有方法多在生成前或后决定弃权,而动态中途弃权则考虑在每一 token 位置提前终止无希望的推理轨迹。本文提出了大语言模型动态弃权的正式分析,将弃权建模为正则化强化学习框架内的显式动作。研究表明,当值函数低于特定奖励参数时进行弃权,在一般条件下严格优于自然基线。数学推理与毒性避免任务的实证结果支持了该理论,并展示了优于现有方法的选择性准确率。

AI 推荐理由

论文核心研究思维链推理中的动态弃权机制,通过理论分析优化推理效率与准确性。

研究机构
University of Oxford
论文信息
作者 Hen Davidov, Nachshon Cohen, Oren Kalinsky, Yaron Fairstein, Guy Kushilevitz et al.
发布日期 2026-04-20
arXiv ID 2604.18419
相关性评分 9/10 (高度相关)