Chain-of-Thought Reasoning Strategy Latency-Accuracy Trade-off
摘要

针对自回归接口中状态更新与公开承诺耦合导致的“沉默税”问题,本文提出“并排(SxS)”交错推理方法。该方法将披露时机作为可控决策,在上下文中交错部分披露与私有推理,仅在推理支持时释放内容。通过构建蕴含对齐的交错轨迹,结合监督微调与强化学习,在不鼓励填充词的前提下习得双重动作语义。实验表明,SxS 在不同架构及内外域基准上均显著提升了准确率与内容延迟的帕累托权衡。

AI 推荐理由

论文核心研究 LLM 推理过程中的披露策略与思维链生成机制,直接优化推理能力。

研究机构
Zhejiang University University of Illinois Urbana-Champaign Cheney You , Qingyun Wang
论文信息
作者 Jiaqi Wei, Xuehang Guo, Pengfei Yu, Xiang Zhang, Wanli Ouyang et al.
发布日期 2026-05-05
arXiv ID 2605.03314
相关性评分 9/10 (高度相关)