Reasoning Efficiency Model Merging Multi-objective Optimization Evolutionary Algorithms
摘要

推理模型虽擅长解决复杂问题,但其长思维链导致巨大的计算开销。针对如何在减少 token 用量的同时保持高精度的“长转短”(L2S)推理难题,现有无训练融合方法存在局限性。本文提出 Evo-L2S 框架,将 L2S 建模为多目标优化挑战,利用进化模型融合技术显式优化准确率与输出长度的权衡,生成鲁棒的帕累托前沿模型。此外,提出基于熵的子集采样技术以降低适应度估计成本。实验表明,该方法在多个数学推理基准上能将推理轨迹长度减少超 50%,同时保持甚至提升解题准确率。

AI 推荐理由

论文核心解决推理模型的长链思维效率问题,直接优化推理准确性与长度权衡。

研究机构
Work done while at Sapienza University of Rome Correspondence nc.minut@di.uniroma1.it Independent Researcher Sapienza University of Rome EPFL NVIDIA
论文信息
作者 Mario Iacobelli, Adrian Robert Minut, Tommaso Mencattini, Donato Crisostomi, Andrea Santilli et al.
发布日期 2026-04-07
arXiv ID 2604.06465
相关性评分 9/10 (高度相关)