论文

当政策改变概率时:LLM 代码审查的模块化决策

When Policies Change Probabilities: Modular Decision-Making for LLM Code Review

模型评测模型行为与机制分析

摘要

LLM 代码审阅者通常会估计补丁风险并在一个提示中做出批准决定。概率应该取决于证据;成本应决定从中采取的行动。我们使用 720 个候选补丁的 15,792 个响应来测试四个已部署的审阅者界面是否保留了这种分离,其中一个通过,一个未通过针对 360 个存储库问题中每一个的存档测试工具。在修复了补丁和监控证据的匹配调用中,用 10:1 错误接受策略更改替换等成本策略,报告的失败概率平均提高了 13.6 至 16.9 个百分点。对于每个审阅者来说,在高成本提示下返回的操作都比拒绝所有补丁更糟糕。对同等成本下得出的概率应用相同的高成本规则可以减少所有四个系统的损失,这表明概率得出本身会导致超额损失。我们还评估了一个模块化管道,该管道在没有策略信息的情况下引发风险,结合了独立的监控分数,并将成本应用于代码中。相对于仅由审阅者校准的分数,该管道提高了平均概率准确性,并且在同等成本下,将每个问题的平均损失降低了 0.073,同时接受 58% 至 68% 的补丁。在 10:1 时,它不接受任何内容并匹配拒绝所有。因此,下游政策可以改变其预期使用的概率,从而推动对风险、外部证据和行动进行单独评估。