论文
对抗式审查:以结构化分歧实现有据可依的智能体代码审查
Adversarial Review: Structured Disagreement for Grounded Agentic Code Review
摘要
早期的多智能体LLM系统常采用角色分工的团队形式,然而在仓库级编码任务上,增加智能体数量的收益递减。近期的替代方案将智能体视为被动工具(子智能体),但这完全消除了智能体交互的好处。我们研究子智能体范式能否支持一种中间地带:无需大型多智能体团队开销的最小化智能体协作。我们提出Adversarial Review(AR),这是一个最小协作的代码审查协议:主编码智能体与审查者、批评者两个智能体协作,审查者评估代码,批评者在主智能体编辑之前通过结构化分歧对审查意见进行审计。在LiveCodeBench上,AR在所测方法中取得最高通过率,仅用三个智能体即超越五个智能体的基线。在SWE-PRBench上,朴素的AR暴露出“虚假共识”失效模式——智能体在没有充分证据的情况下达成一致——而一次显式加入分歧的提示迭代在所测方法中取得最高F1。在SWE-bench Verified上,AR在仓库级编码任务上也优于基线。总之,AR表明协作式代码审查既不需要很多智能体,也不需要复杂的通信结构:它需要的是分歧最小化、结构化且有证据支撑。
