reasoning strategy model diversity compute scaling theoretical framework
摘要

大语言模型推理的计算扩展需要在探索解法(广度)与优化候选解(深度)之间分配预算。现有方法隐含地权衡二者,但其有效性原因不明,且单模型验证掩盖了模型自身的作用。本文主张最优策略取决于模型的多样性特征,即概率质量在解法上的分布,必须在采用探索策略前对此进行刻画。通过分解推理不确定性的理论框架,推导了树式深度优化优于并行采样的条件。在 Qwen-3 和 Olmo-3 系列模型上的验证表明,低多样性对齐模型仅需轻量信号即可进行深度优化,而高多样性基座模型则需要更强的补偿机制以弥补探索覆盖率的不足。

AI 推荐理由

论文核心研究模型多样性对推理策略(广度与深度权衡)的决定性作用,提出理论框架并验证。

研究机构
UTUC Capital One
论文信息
作者 Moulik Choraria, Argyrios Gerogiannis, Anirban Das, Supriyo Chakraborty, Berkcan Kapusuzoglu et al.
发布日期 2026-04-12
arXiv ID 2604.10827
相关性评分 9/10 (高度相关)