Tool Use Superintelligence Reasoning Benchmark Agent Capabilities
摘要

本文提出“勤奋学习者”框架,认为若具备足够的步骤成功率,LLM 可通过测试时搜索实现超级智能。为此,我们构建了基于 GF(2) 电路重构的基准测试,该任务难度随推理步数递增,且从信息论角度看需整合全部信息方可解决。分析表明,小模型成功率随深度超线性下降,而前沿模型表现出部分鲁棒性。研究进一步发现,大规模成功推理依赖于精确的工具调用,凸显工具设计作为 LLM 迈向通用超级智能关键能力的重要性。

AI 推荐理由

论文核心论证精确的工具调用是实现大规模推理和超级智能的关键前提。

论文信息
作者 David Koplow, Tomer Galanti, Tomaso Poggio
发布日期 2026-02-24
arXiv ID 2602.21061
相关性评分 9/10 (高度相关)