摘要
针对现有基准多测试广泛知识或局部步骤的局限,本文提出 SpatialBench-Long,旨在评估智能体在长程空间生物学中的端到端科学推理能力。该基准要求智能体在无预设方法下,从原始数据及实验背景中恢复生物学主张,涵盖多种癌症模型及前沿空间转录组技术。通过严格的复现与评审机制硬化候选主张,并采用确定性评分标准。实验显示当前顶尖模型表现有限,表明智能体需从程序性执行迈向复杂的科学结论推导。
AI 推荐理由
论文核心评估 Agent 从原始数据推导科学结论的端到端推理能力,而非单纯执行流程。
研究机构
LatchBio, San Francisco, CA, USA
论文信息