摘要
针对单细胞生物学领域大语言模型评估碎片化及指标缺乏可解释性的问题,本文提出 SC-Arena 框架。该框架定义“虚拟细胞”抽象以统一评估目标,涵盖细胞注释、扰动预测等五项自然语言任务,旨在探测核心推理能力。此外,引入结合外部本体与文献的知识增强评估方法,克服传统字符串匹配的局限性。实验表明,当前模型在复杂因果推理任务上表现不均,而该框架能提供符合生物学事实且可解释的评估结果。
AI 推荐理由
论文核心构建单细胞推理基准,评估模型在生物学任务中的因果与机制推理能力。
研究机构
东北大学软件学院, 中国
深圳先进技术研究院, 中国
中国科学技术大学深圳研究院, 中国
论文信息