摘要
针对前沿模型在现有基准上表现优异难以区分能力的现状,本文提出 DeepWeb-Bench,一个更具挑战性的深度研究基准。该基准要求智能体进行海量证据收集、跨源协调及长程多步推导。研究将任务难度划分为检索、推导、推理和校准四类能力。实验发现,检索并非瓶颈,推导与校准失败占错误总数的 70% 以上;强弱模型失败模式各异,且模型在不同领域表现出显著的专业化差异。
AI 推荐理由
论文核心评估长程多步推导与跨源推理能力,指出推导失败是主要瓶颈。
研究机构
Peking University
论文信息