internal skill complex reasoning reinforcement learning agentic harness
摘要

近期智能体编排框架在复杂推理任务中表现优异,但其核心驱动机制尚不明确。本文提出 HeavySkill,主张将“重思考”不仅视为执行单元,更内化为模型参数中的内部技能。该技能由“并行推理后总结”两阶段构成,可嵌入任意智能体框架。实证研究表明,该方法优于传统最佳选择策略,强模型甚至接近 Pass@N 性能。此外,通过强化学习可扩展该技能的深度与宽度,为不依赖脆弱编排层的自进化大模型提供新路径。

AI 推荐理由

论文核心提出“重思考”作为内部技能,通过并行推理与总结机制显著提升复杂推理任务性能。

研究机构
Meituan LongCat Team
论文信息
作者 Jianing Wang, Linsen Guo, Zhengyu Chen, Qi Guo, Hongyu Zang et al.
发布日期 2026-05-04
arXiv ID 2605.02396
相关性评分 9/10 (高度相关)