推理能力评估 技能缺口分析 基准测试 支架式学习
摘要

基准测试常被用于评估大语言模型在不同领域的能力,但聚合分数难以揭示具体的组合技能缺口及改进方向。为此,本文提出支架式任务设计(STaD)框架。该框架基于“支架”概念生成受控的基准任务变体,以逐步递增的方式提供结构化支持。不同于单独检查失败案例,该方法能系统且可扩展地探测模型行为,精准定位其缺乏的特定推理技能组合。通过对六种不同规模模型的实验,研究在三个推理基准中揭示了多个失败点,并突显了各模型独特且差异化的技能缺口。

AI 推荐理由

论文核心在于通过支架式任务设计识别 LLM 的组合推理技能缺口,直接针对推理能力评估。

研究机构
IBM Research
论文信息
作者 Sungeun An, Swanand Ravindra Kadhe, Shailja Thakur, Chad DeLuca, Hima Patel
发布日期 2026-04-20
arXiv ID 2604.18177
相关性评分 9/10 (高度相关)