Hybrid-Reasoning Thinking-Mode Switching Efficiency-Accuracy Trade-off Benchmark
摘要

混合推理大语言模型允许显式控制推理力度,以平衡答案质量与推断成本。然而,现有自适应思维模式选择方法评估标准不一,难以比较。本文提出 HRBench,一个用于研究混合推理 LLM 思维模式切换的统一评估框架。该框架沿两个维度组织设计空间:三种切换策略家族(基于提示的选择、外部路由、推测执行)和四种训练机制,共形成 12 种受控评估设置。我们在 6 个大模型和 5 个涵盖数学、科学及代码的推理基准上评估了这些设置,并复现了 12 种代表性 prior 方法。分析表明不同策略在效能 - 效率权衡中占据不同区域,且偏好策略随模型规模与任务领域变化。

AI 推荐理由

论文核心研究混合推理 LLM 的思维模式切换策略,直接优化推理效率与质量的权衡。

研究机构
AI Thrust, The Hong Kong University of Science and Technology (Guangzhou) AIPD, Tencent
论文信息
作者 Yansong Ning, Mianpeng Liu, Jingwen Ye, Weidong Zhang, Hao Liu
发布日期 2026-05-27
arXiv ID 2605.28398
相关性评分 9/10 (高度相关)