摘要
本文提出 CrackMeBench,一个用于评估语言模型智能体在教育类逆向工程任务中表现的基准测试。该基准专注于确定性二进制验证问题,要求智能体仅凭可执行文件恢复验证逻辑并生成有效输入。实验在隔离的 Linux 环境中进行,提供标准逆向工具。评估结果显示,GPT-5.5 在生成任务集上表现最佳(pass@3 为 92%),显著优于其他模型。该基准通过记录通过率、耗时及工具使用情况,为衡量从源代码推理向自主二进制分析的进步提供了可复现的测试平台。
AI 推荐理由
论文核心评估 Agent 使用逆向工程工具解决二进制问题的能力,属于典型的技能学习与工具使用范畴。
研究机构
University College London
论文信息