摘要
针对现有化学基准仅评估最终答案而忽略推理逻辑缺陷的问题,本文提出 ChemCoTBench-V2。该基准通过专家设计的模板强制模型暴露关键中间步骤,并利用确定性化学规则进行低成本、可审计的过程级验证。实验揭示前沿模型在最终答案正确性与结构化推理状态一致性之间存在显著差距,常出现格式合规但推理错误或答案正确但支撑薄弱的情况,实现了细粒度的模型诊断。
AI 推荐理由
论文核心聚焦于化学领域的逻辑推理过程评估,提出验证中间步骤一致性的新方法。
研究机构
北京大学
论文信息