LLM 推理 任务复杂度 情感分析 实证研究
摘要

本文通过评估七个模型家族的 504 种配置,检验了推理能力普遍提升语言任务性能的观点。研究发现推理效果高度依赖任务复杂度:二元分类性能显著下降,而复杂的情感识别则大幅提升。蒸馏推理变体在简单任务上表现不佳,少样本提示可部分恢复。帕累托前沿分析表明,仅在复杂任务中引入推理才具合理性,尽管其计算开销巨大。定性分析揭示,过度 deliberation 导致简单任务性能退化。

AI 推荐理由

论文核心研究 LLM 推理能力在不同任务复杂度下的表现差异及机制。

研究机构
新加坡管理大学信息与计算机系统学院 美国弗吉尼亚州阿灵顿市研究与发展中心
论文信息
作者 Donghao Huang, Zhaoxia Wang
发布日期 2026-02-27
arXiv ID 2602.24060
相关性评分 9/10 (高度相关)