从翻译到超集:生产型 AI 代理从 Rust 到 Python 的基准驱动演变
From Translation to Superset: Benchmark-Driven Evolution of a Production AI Agent from Rust to Python
摘要
大型软件系统的跨语言迁移是一项持续存在的工程挑战,特别是当源代码库快速发展时。我们提出了一种 LLM 辅助的连续代码翻译方法,其中 大语言模型 将生产 Rust 代码库(648K LOC,65 个板条箱)翻译为 Python(41K LOC,28 个模块),并以公共代理基准作为驱动迭代细化的目标函数。我们的主题系统是 Codex CLI,一个生产型 AI 编码智能体。我们证明:(1) Python 端口解决了 59/80 SWE-bench 验证任务 (73.8%),而 Rust 为 56/80 (70.0%),并且在 Terminal-Bench 上实现了 42.5%,而 Rust 为 47.5%,证实了在现实世界代理任务上几乎相同; (2) 基准测试驱动的调试,揭示 API 协议不匹配、环境污染、静默 WebSocket 故障模式和 API 400 崩溃,比单独静态测试更有效; (3) 该架构通过 LLM 辅助的 diff-translate-test 环路支持连续的上行同步; (4) Python 端口已发展成为一个功能超集,具有 Rust 所没有的 30 个功能标记扩展(多代理编排、语义记忆、监护人安全、成本跟踪),同时保留严格的奇偶校验模式以进行比较。我们的评估表明,对于 API 延迟占主导地位的基于 LLM 的代理,Python 的表达能力使代码减少了 15.9 倍,而性能成本可以忽略不计,而基准作为目标函数方法提供了一个原则框架,用于将跨语言端口从奇偶校验发展为扩展平台。