Inference-time Optimization Paradigm Routing LLM Agents Reasoning Paradigms
摘要

本文探讨了基于 LLM 的代理在任务上的提升是源于模型本身还是其周围的推理范式。通过对比六种推理时范式在四个前沿模型和十个基准测试中的表现,研究发现推理结构在不同任务上效果差异显著,单一范式无法主导所有场景。受此互补性启发,作者提出“先选后解”方法:利用轻量级嵌入路由器为每个任务选择最合适的推理范式。实验表明,该方法显著提升了平均准确率,优于最佳固定范式,并有效缩小了与理想选择的差距,论证了推理范式选择应作为基于学习的逐任务决策。

AI 推荐理由

论文核心研究不同推理范式(如 CoT, ReAct)对 LLM 性能的影响及动态选择机制。

研究机构
中国科学院自动化研究所
论文信息
作者 Heng Zhou, Zelin Tan, Zhemeng Zhang, Yutao Fan, Yibing Lin et al.
发布日期 2026-04-08
arXiv ID 2604.06753
相关性评分 9/10 (高度相关)