摘要
大语言模型在科学发现中潜力巨大,但缺乏对其动态推理能力的系统评估。现有基准多基于静态问答,难以衡量复杂科学任务中的多步迭代表现。为此,本文提出 MolQuest,一个基于真实化学实验数据的代理评估框架。该框架将分子结构解析形式化为多轮交互任务,要求模型主动规划实验步骤、整合异构光谱数据并迭代修正假设,从而系统评估其溯因推理与战略决策能力。实验表明,当前最先进模型在此类任务中准确率仅约 50%,凸显了现有模型在科学推理方面的显著不足。
AI 推荐理由
论文核心评估 LLM 在化学结构解析中的溯因推理能力,聚焦多步迭代推理机制。
研究机构
Alibaba Group, Hangzhou, China
论文信息