摘要
本文提出“超级研究”任务,旨在解决需长程规划、海量证据收集及多源综合的高度复杂问题。该方法整合了结构化研究计划分解、超广检索以获取多元视角,以及超深调查以迭代消除不确定性。作者构建了包含 300 个专家编写问题的基准测试,要求模型执行百余次检索并综合上千网页。此外,提出了基于图的审计协议,从覆盖率、逻辑一致性等五维度评估系统,为 LLM 的研究能力提供了关键的极限压力测试。
AI 推荐理由
论文核心在于长程任务规划、结构化分解及多步计划生成,以解决复杂研究问题。
研究机构
计算机科学与技术学院,蚂蚁集团,杭州,中国
论文信息