论文

评估 Dart AOT 二进制文件的神经反编译:微调、指标有效性、规范泄漏和可靠性

Evaluating Neural Decompilation of Dart AOT Binaries: Fine-Tuning, Metric Validity, Specification Leakage, and Reliability

模型评测评测方法与指标

摘要

我们对 Dart 提前二进制文件的神经反编译进行了基于执行的评估,并对其分数衡量的内容进行了审核。通过六个存档的适配器基线比较,在 k = 1、5 和 10 处对 pass@k 进行配对测试,并在 18 个端点上进行 Holm 调整,确定 Qwen3-8B 适配器在每个 k 处的功能回归。其他四个比较都没有结论。在 141 个经过参考认证、合同有效的任务中,三个独立训练的图前缀系统对相同的候选者进行了评分。 Best CodeBLEU 与 pass@10 的关联性不大 ($ρ$ = .218-.246),compile@10 的关联性较弱 ($ρ$ = .072-.082),只有 21.0-23.3% 的编译候选者通过。配对单种子干预删除了语义名称和相关线索,同时保留类型、数量和指令内容,将覆盖范围从 42/154 减少到 7/154 任务。匹配图扰动显示在语义契约下没有可检测到的退化(六次测试 Holm p >= .750);指令使用归因仍未解决。在 MF-174 上的五个解码种子中,基线平均解决了 4.8 个任务,其中至少解决了一次 15 个任务,并且每个种子都解决了一个任务。我们建议验证引用、调整共享候选者的指标、将元数据与二进制输入分离、重复采样并保留出处。发布的胶囊支持完整性检查和存档结果的重放。