论文

AgentModernize:使用多代理 LLM 和行为规范图在遗留现代化中保留业务逻辑

AgentModernize: Preserving Business Logic in Legacy Modernization with Multi-Agent LLMs and Behavioral Specification Graphs

智能体系统Agent 架构与控制循环

摘要

遗留现代化破坏业务逻辑的频率比大多数团队预期的要高。大多数工具和基于 LLM 的方法将现代化视为语法翻译:将 COBOL 转换为 Java,将 PL/SQL 交换为 Python,然后交付。保持生产系统运行的隐式规则、边缘情况处理和跨模块约束都丢失了,直到生产中出现故障为止,没有人注意到。我们提出了 AgentModernize,这是一个将现代化视为行为保存问题的多智能体框架。四个代理处理提取、规范、代码生成和验证。关键的中间工件是行为规范图 (BSG),它强制提取的业务逻辑在生成任何代码之前变得明确且可检查。我们在 LegacyModernize-8 上进行了评估,这是跨越电信和银行业的八个综合场景,在公平协议下,每种方法的测试都是从其自己的 API 表面生成的(3 次试验,温度 0.0)。使用 GPT-4o-mini,带反馈的 AgentModernize 平均 BER 达到 23.0%(在 5/8 场景下非零,高达 53.3%),而不带反馈的 AgentModernize 达到 23.8%。 SP-LLM 得分为 12.4%(2/8 时非零),CoT-LLM 得分为 4.5% (2/8)。没有一种方法可以主宰所有场景。反馈循环对于需要迭代校正的场景(S4、S6、S7)至关重要,但可以在其他场景(S2、S8)中回归代码。 BSG 捕获了 92.3% 的黄金标准规则,精度为 90.2%;瓶颈是代码生成,而不是提取。跨模型研究(GPT-4o、GPT-5.3-codex)揭示了管道的优势与模型能力成反比:使用单提示方法的更强模型比使用管道实现更高的 BER。对于受监管的行业,管道的可追踪工件(业务规则清单、BSG、等效报告)提供了单一提示方法无法比拟的审计跟踪。