Benchmark Scientific Data Reasoning Computation LLM Evaluation
摘要

本文介绍了 SciTaRC,这是一个由专家构建的基准数据集,包含针对科学论文中表格数据的问题,这些问题需要深度的语言推理和复杂的计算能力。研究表明,当前最先进的 AI 模型至少在 23% 的问题上失败,即使是 Llama-3.3-70B-Instruct 等高性能开源模型,失败率也高达 65.5%。分析揭示了一个普遍的“执行瓶颈”:即使提供了正确的策略,代码模型和语言模型都难以忠实执行计划。具体而言,基于代码的方法在处理原始科学表格时表现脆弱,而自然语言推理主要因初始理解问题和计算错误而失败。

AI 推荐理由

论文核心评估模型在科学表格数据上的深度语言推理与复杂计算能力,直接针对推理瓶颈。

研究机构
约翰霍普金斯大学语言与语音处理中心
论文信息
作者 Hexuan Wang, Yaxuan Ren, Srikar Bommireddypalli, Shuxian Chen, Adarsh Prabhudesai et al.
发布日期 2026-03-09
arXiv ID 2603.08910
相关性评分 9/10 (高度相关)