摘要
大型语言模型在代码生成方面潜力巨大,但在进攻性网络安全所需的多步状态推理上表现欠佳。现有研究多依赖无法反映真实漏洞动态性的静态基准。本文提出 STRIATUM-CTF,这是一个基于模型上下文协议(MCP)构建的模块化智能体框架。通过标准化系统内省、反编译和运行时调试的工具接口,该框架使智能体能在漫长的利用轨迹中保持连贯的上下文窗口。我们在真实的大学举办的夺旗赛(CTF)中验证了该方法,系统自主识别并利用漏洞,击败 21 支人类队伍获得冠军。分析表明,基于 MCP 的工具抽象显著减少了幻觉,证明了标准化上下文协议对构建鲁棒自主网络推理系统的关键作用。
AI 推荐理由
论文核心解决多步状态推理难题,提出基于协议的推理框架并在实战中验证。
研究机构
佛罗里达州立大学计算机科学系
论文信息