摘要
大型推理模型(LRMs)虽具备卓越推理能力,但常因“过度思考”生成冗长答案,或在超纲问题上因“过度自信”输出简短错误结果。为此,本文提出难度差异化策略优化(DDPO)算法,针对简单任务缩短输出长度,对复杂任务扩展探索空间。理论推导表明,长度分布应逼近最优且高度集中。实验显示,相比 GRPO,DDPO 在多个基准上将平均回答长度减少 12%,准确率提升 1.85%,实现了精度与长度的更佳平衡。
AI 推荐理由
论文核心解决大型推理模型的过度思考与自信问题,直接优化推理效率与准确性。
研究机构
中国机构未明确标注
论文信息