tool use reverse engineering agent framework reproducibility
摘要

由于原始论文未公开工具细节及智能体框架,尚无独立研究复现 OpenAI 发布的 gpt-oss-20b 工具得分。本文逆向工程了该模型的分布内工具:即使未提供工具定义,模型仍能以高统计置信度调用训练分布中的工具,表明这是强先验而非幻觉。随后,我们构建了原生 Harmony 智能体框架,采用模型原生格式编码消息,规避了 Chat Completions 转换的信息损耗。结合上述方法,我们首次独立复现了官方得分:SWE Verified HIGH 为 60.4%(官方 60.7%),MEDIUM 为 53.3%(官方 53.2%),带工具的 AIME25 为 91.7%(官方 90.4%)。

AI 推荐理由

论文核心在于复现并优化模型的工具调用能力,通过逆向工程揭示其内在工具先验,属于技能学习范畴。

研究机构
borislav.mavrin@gmail.com
论文信息
作者 Borislav Mavrin
发布日期 2026-04-01
arXiv ID 2604.00362
相关性评分 9/10 (高度相关)