摘要
基准测试常被用于评估大语言模型在不同领域的能力,但聚合分数难以揭示具体的组合技能缺口及改进方向。为此,本文提出支架式任务设计(STaD)框架。该框架基于“支架”概念生成受控的基准任务变体,以逐步递增的方式提供结构化支持。不同于单独检查失败案例,该方法能系统且可扩展地探测模型行为,精准定位其缺乏的特定推理技能组合。通过对六种不同规模模型的实验,研究在三个推理基准中揭示了多个失败点,并突显了各模型独特且差异化的技能缺口。
AI 推荐理由
论文核心在于通过支架式任务设计识别 LLM 的组合推理技能缺口,直接针对推理能力评估。
研究机构
IBM Research
论文信息