论文

作为人工智能辅助代码审查的行为约束的哲学倾向:一项实证研究

Philosophical Dispositions as Behavioral Constraints for AI-Assisted Code Review: An Empirical Study

智能体系统Agent Harness

摘要

人工智能辅助代码审查工具通常作为通用“专家审查者”代理运行,无论所需的分析类型如何,都会产生同质的结果。我们提出了一个通过哲学倾向来约束人工智能审稿人行为的系统——基于特定认识论传统(皮浪怀疑论、Navya-Ny=aya逻辑、第欧根尼的犬儒主义、儒家关系伦理)的连贯的人格镜头,将注意力集中在结构上不同类型的问题上。每个处置都被明确地定义(通过它拒绝做什么),配备了自我监控故障模式(hamartia),并按角色协议按顺序编排。我们在跨 7 个存储库的 50 个合并拉取请求上评估了该系统,涵盖 5 种编程语言(Python、Go、C++、Java、Terraform)、5 个组织(2 个企业、3 个开源)和 2 个时间时代(AI 之前的 2020 年、AI 后的 2024--2026 年)。该处置系统与人类评审员的收敛率达到 46%(验证信号质量),以 75% 的比率识别出独特的结果,并且在 601 个总结果中没有产生被作者判断为假阳性的结果(未评估评估者间的一致性,这仍然是一个限制)。受控基线比较表明,51% 的处置结果不是由使用通用“专家审阅者”提示的同一模型得出的,并且这些独特的结果针对的是结构、操作和逻辑问题,而不是标准代码级问题。对 3 个 PR 的初步跨模型验证(Claude Opus 与\ GPT Codex 5.3-xhigh)显示 100% 的框架结构一致性和 39% 的发现水平一致性,表明该框架提供了真正的行为约束,同时保留了特定于模型的分析视角。