论文
LLM 有利于他们的提供商吗?测量代码生成中的垂直集成偏差
Do LLMs Favor Their Providers? Measuring Vertical Integration Bias in Code Generation
摘要
大语言模型 (LLM) 已成为软件开发不可或缺的一部分,特别是随着代理功能的出现。然而,许多前沿 LLM 都隶属于特定的提供商。这就提出了一个问题,即生成的代码是否比同类替代方案更有利于提供商自己的生态系统,从而可能限制开发人员的选择并增加对单个提供商的依赖。我们将这种行为定义为垂直集成偏差 (VIB),并引入 \textsc{VIBench},这是一个基准,用于在 20 的提供商可选软件集成场景中测量直接和代理代码生成中的 VIB。将 10 的前沿提供商附属模型与 3 的非附属控制进行评估,我们发现直接生成具有积极的 VIB,十个附属模型中有六个显示出统计上显着的影响,高达 $+18.8$ 个百分点 (pp)。代理工作流程进一步放大了 VIB,达到了 $+39.2$ pp。此外,代理工作流程中的早期附属生态系统选择可以持续到概念上解耦的下游文件中,持久性高达 $90.3\%$。这些发现强调了在代码生成中衡量和解释 VIB 的必要性,尤其是在代理功能变得更加普遍的情况下。