摘要
混合推理大语言模型允许显式控制推理力度,以平衡答案质量与推断成本。然而,现有自适应思维模式选择方法评估标准不一,难以比较。本文提出 HRBench,一个用于研究混合推理 LLM 思维模式切换的统一评估框架。该框架沿两个维度组织设计空间:三种切换策略家族(基于提示的选择、外部路由、推测执行)和四种训练机制,共形成 12 种受控评估设置。我们在 6 个大模型和 5 个涵盖数学、科学及代码的推理基准上评估了这些设置,并复现了 12 种代表性 prior 方法。分析表明不同策略在效能 - 效率权衡中占据不同区域,且偏好策略随模型规模与任务领域变化。
AI 推荐理由
论文核心研究混合推理 LLM 的思维模式切换策略,直接优化推理效率与质量的权衡。
研究机构
AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)
AIPD, Tencent
论文信息