摘要
本文对七种最新的面向推理的指令微调模型(涵盖稠密与混合专家架构)进行了受控实证基准测试。研究在四种基准数据集上,评估了零样本、思维链及少样本思维链三种提示策略下的表现,记录了准确率、延迟、显存占用及计算量。结果表明,稀疏激活本身不能保证最佳实践效果,准确率与效率的权衡取决于架构、提示协议及任务构成的共同作用。研究发布了可复现的基准流程以支持资源约束下的推理模型评估。
AI 推荐理由
论文核心评估多种推理模型在不同提示策略下的推理准确率与效率权衡。
研究机构
计算机科学与工程学院,伦斯勒理工学院
生物医学工程系,伦斯勒理工学院
论文信息