摘要
本文通过评估七个模型家族的 504 种配置,检验了推理能力普遍提升语言任务性能的观点。研究发现推理效果高度依赖任务复杂度:二元分类性能显著下降,而复杂的情感识别则大幅提升。蒸馏推理变体在简单任务上表现不佳,少样本提示可部分恢复。帕累托前沿分析表明,仅在复杂任务中引入推理才具合理性,尽管其计算开销巨大。定性分析揭示,过度 deliberation 导致简单任务性能退化。
AI 推荐理由
论文核心研究 LLM 推理能力在不同任务复杂度下的表现差异及机制。
研究机构
新加坡管理大学信息与计算机系统学院
美国弗吉尼亚州阿灵顿市研究与发展中心
论文信息