论文

使用 编码智能体 进行 N 版本编程

N-Version Programming with Coding Agents

智能体系统Agent任务评测

摘要

本文在当代人工智能 编码智能体 的背景下重新审视 N 版本编程的经典概念。回顾具有开创性的 Knight-Leveson 实验,我们研究了代理系统、模型和实现语言之间的多样性是否会造成不同的故障模式。使用 Knight-Leveson 的发射拦截器程序规范,我们在共享预言机和 1,000,000 个随机测试输入的活动上评估了 48 个代理生成的实现。结果表明存在大量共模故障,这与 Knight-Leveson 的研究结果一致。进一步分析发现,许多同时发生的故障都可以追溯到规范特别困难或不明确的地方。我们还证明,编码智能体 的多样性提供了实际好处:在多数投票的三版本单元中,平均故障计数从单一版本的 387.44 下降到三元组的 130.99,并且 11,844 个 N 版本单元表现出零观察到的故障。我们最初的结果是迄今为止最有力的证据,证明使用 编码智能体 进行 N 版本编程是一种有用的工程策略。