LLM 优化 推理效率 零成本增强 指令微调
摘要

针对大语言模型中间推理痕迹导致的高延迟与成本问题,本文提出“后推理”方法。该方法通过让模型在生成最终答案后再补充理由,实现了无额外延迟或令牌成本的性能提升。实验涵盖 117 个模型 - 基准设置,结果显示该方法在超 88% 的场景中有效,平均相对提升 17.37%。此外,提出的监督后推理微调进一步将有效率提升至 91% 以上,证明该机制可通过训练内化,确立了直接回答能力的新性能上限。

AI 推荐理由

论文核心提出“后推理”机制,直接优化非思维模型的推理表现与效率。

研究机构
南洋理工大学
论文信息
作者 Richmond Sin Jing Xuan, Rishabh Bhardwaj, Soujanya Poria
发布日期 2026-05-07
arXiv ID 2605.06165
相关性评分 9/10 (高度相关)