论文
比较代码评估中的开发人员偏差和 LLM 偏差
Comparing Developer and LLM Biases in Code Evaluation
摘要
由于 LLM 越来越多地在代码应用程序中用作判断器,因此应该在捕获部分上下文和模糊意图的现实交互设置中对其进行评估。我们提出了TRACE(代码评估中的Rubric分析工具),这是一个框架,用于评估LLM法官预测人类偏好的能力,并自动提取Rubric项目以揭示人类和模型如何衡量每个项目的系统偏差。通过三种模式——基于聊天的编程、IDE 自动完成和指导代码编辑——我们使用 TRACE 来衡量 LLM 的判断与开发人员偏好的一致程度。在 13 个不同的模型中,最好的评判者的表现比人类注释者低 12-23%。 TRACE 确定了人类和法官之间交互方式中 35 个重要的不一致来源,其中大部分符合现有的软件工程代码质量标准。例如,在基于聊天的编码中,法官偏向于较长的代码解释,而人类则更喜欢较短的代码解释。我们发现大多数现有代码质量维度存在显着的不一致,这表明 LLM 法官与实际编码应用中的人类偏好之间存在对齐差距。