论文
PairCoder++:结对编程作为验证代码驱动的多模式和结构化工件生成的通用范式
PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation
摘要
代码是 大语言模型 生成结构化工件的媒介:图表、科学图形、矢量图形、CAD 模型、3D 场景和硬件设计都是通过编写程序生成的。在这种情况下,单遍推理很脆弱,因为决定工件是否存在的编译器、渲染器或模拟器对模型来说是不可见的。我们提出了 PairCoder,它在工具链中进行审查,并将其实现为两个代理对编程:一个驱动程序代理编写程序,一个导航代理根据验证证据(诊断、执行结果和目标旁边的当前工件的渲染)对其进行审查,并且当错误持续存在时,这两个角色会切换。在来自三个供应商的 17 个公共基准测试和 7 个模型中,PairCoder 基本上改进了每个工件可验证的基准测试,在完整的官方度量套件上,而不是单独执行(例如,Blender 场景可执行性 0.20 到 0.78;每个模型的 TikZ 编译率提高 10 到 30 个点),单个模型成本的 2.9 到 9.2 倍(大约是总体的 7 倍)。改进集中在工具链提供信息丰富的预言机和基线留下空间的地方,以及该方法在预言机薄弱的地方联系或轻微回归的地方;我们将结对编程视为验证代码驱动生成的可靠方法。