论文

CrackMeBench:代理的二进制逆向工程

CrackMeBench: Binary Reverse Engineering for Agents

智能体系统Agent任务评测

摘要

编码智能体 的基准越来越多地衡量源级软件修复,网络安全基准越来越多地衡量广泛的捕获标志性能。经典的二进制逆向工程仍然不太精确:仅给定一个可执行文件,代理能否恢复验证逻辑并生成程序接受的输入、序列、工件或密钥生成器?我们推出了 CrackMeBench,这是一个用于在 CrackMe 式逆向工程教育任务上评估语言模型代理的基准。 CrackMeBench 专注于可执行预言机、符号贫乏的二进制文件、显式本地工具访问和外部评分提交的确定性二进制验证问题,而不是自由格式的解释。 v0 基准测试结合了 8 个公共校准 CrackMe 和 12 个由种子 C、Rust 和 Go 模板生成的主要评分任务,并且代理通过标准逆向工程工具在无网络 Linux Docker 沙箱中的同等 shell 接口运行。在预算为 5 分钟、每个任务有 3 个评分提交的三模型评估中,GPT-5.5 生成的分割的 pass@3 为 11/12 任务 (92%),Claude Opus 4.7 为 7/12 (58%),Kimi K2 为 5/12 (42%)。生成的一半越难,模型的分离就越明显,pass@3 分别为 5/6、2/6 和 1/6;在八任务公共校准分割中,pass@3 是 3/8、2/8 和 1/8。 CrackMeBench 记录 pass@1 和 pass@3、评分提交、挂钟时间、命令跟踪、工具类别、提供商报告的词元使用情况、估计成本和定性失败标签,提供一个可重复的测试平台,用于衡量从源代码推理到自主二进制分析的进度,同时将范围限制为教育、专用程序。