论文
跨模型 LLM 代码审查:您应该使用 Claude 来审查 Codex 还是反之亦然?
Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?
摘要
开发人员越来越多地同时使用两台 编码智能体:一个编写草稿,另一个进行审阅。然而,目前尚不清楚这种配对是否值得花费成本和时间,也不清楚配对的顺序是否重要。我们与 Claude 和 Codex 在 6 种条件下对 116 个最近的困难和中等 lcb 任务进行了对照实验,以近似软件从业人员的工作流程:两个单独基线、两个跨模型排序和两个相同模型排序。审阅者看到问题和作者的草稿,但无法执行测试,这类似于代码审阅步骤。克劳德审查将法典草案从 71.6% 提高到 89.7% ($p_{BH}=.001$);法典自我审查将其提高到 84.5% ($p_{BH}=.022$)。相反的方向不会有回报:法典审查克劳德草稿将通过率从 91.4% 降至 82.8% ($p_{BH}=.046$),而克劳德自我审查则保持 91.4% 的基线不变。我们的评估表明,有用的配对是不对称的:使用 Claude 来审查 Codex,而不是相反。