adaptive reasoning test-time computation stateful refinement process reward models
摘要

扩展测试时计算可增强大语言模型推理能力,但面临均匀计算悖论:同等资源分配导致简单任务过度修正而复杂任务精炼不足。为此,我们提出 CoFiCot,一种由粗到细的自适应框架,能根据问题难度动态定制推理策略。该框架通过多指标分类器综合语义熵、共识可靠性及预测推理深度对查询进行分流,实现差异化精炼:简单查询采用高效聚合,复杂查询则进入上下文感知修正循环。我们将修正形式化为状态化序列传播过程,确保每次修复严格基于已验证的历史修正记录,有效桥接细粒度错误定位与全局逻辑连贯性。

AI 推荐理由

论文核心提出自适应推理框架,动态调整计算资源以优化不同难度问题的推理效果。

研究机构
西安交通大学 浙江大学 香港中文大学(深圳) 中国科学院自动化研究所
论文信息
作者 Dongxu Zhang, Hongqiang Lin, Yiding Sun, Pengyu Wang, Qirui Wang et al.
发布日期 2026-03-09
arXiv ID 2603.08251
相关性评分 9/10 (高度相关)