摘要
扩大大型语言模型测试时计算量的有效方法是采样多个响应并选择最佳者。现有方法多依赖外部奖励模型,带来训练成本与计算开销。本文观察到高熵令牌在推理中倾向于聚集成连续簇,揭示了不确定性的时间模式。据此,我们提出利用不确定性时间结构作为内在奖励,定义“高熵阶段”及灵感源自物理质心的“熵质心”。直觉上,较低的质心意味着早期探索后接自信生成,通常对应更高响应质量。基于此,我们提出“最低质心”方法,在多个候选中选择熵质心最低的响应。实验表明,该方法在数学、代码生成、逻辑推理及代理任务上均优于现有基线。
AI 推荐理由
提出基于熵质心的推理时选择方法,显著提升数学、代码及逻辑推理任务表现。
研究机构
HKUST
ZJU
Huawei
论文信息