LLM Benchmark Mechanistic Reasoning Toxicity Prediction Adverse Outcome Pathway
摘要

大型语言模型虽能预测分子属性,但毒性源于复杂生物机制,需机制性推理以确保可靠。现有基准缺乏对此能力的系统评估,且模型常生成流畅但生物学不准确的解释。为此,本文提出 ToxReason 基准,基于不良结局通路(AOP),整合药物 - 靶点相互作用证据与毒性标签,要求模型从分子起始事件推导至不良结局。评估发现高预测性能未必对应可靠推理,而引入推理意识的训练可显著提升机制推理及预测表现,证明了将推理融入评估与训练的必要性。

AI 推荐理由

论文核心在于评估和提升 LLM 在化学毒性预测中的机制推理能力,强调推理质量对结果可信度的关键作用。

研究机构
韩国大学
论文信息
作者 Jueon Park, Wonjune Jang, Chanhwi Kim, Yein Park, Jaewoo Kang
发布日期 2026-04-07
arXiv ID 2604.06264
相关性评分 9/10 (高度相关)